⏭️ Forward Deployed:2026年语音AI,哪些方案真正有效
⏭️ Forward Deployed:2026年语音AI,哪些方案真正有效
摘要
- 这场讨论给出的执行层面结论是:级联式 STT→LLM→TTS 仍是企业默认架构,而非 speech-to-speech。 一位语音平台嘉宾用一个预约机器人说明 S2S 的风险:机器人先回答“下周”,随后说“好的,是6月10日吗?”;被纠正年份后,它又说:“你说得对,现在是2030年,那我们就安排在2030年6月10日吧。”Smallest AI 嘉宾则称,企业目前仍有“多得多的级联部署”,而 S2S 是“最终的未来”——更可能出现的混合架构是由 S2S 负责实时对话,把复杂查询交给级联链路。
- Basil 将语音称为“当前 AI 最具竞争性的市场之一”,主持人则把客户支持视为主导用例——呼叫中心耗费了数千亿美元,但体验全都很糟糕。 主持人的编辑标准很直接:供应商夸耀自己的 pipeline,只能算“这不是废话吗”;真正值得报道的信号,是一线从业者承认“模型还没到那个程度,可能永远也到不了”(the models are not there yet. They may never be.)。
- 主持人称,他认为“语音 AI 领先编码代理一代”——如今在编码工具中走红的上下文压缩,从第一天起就是语音 AI 的标配,因为早期模型到 10,000 个 token 就会失控。 即便是拥有100万个 token 上下文的模型,他的经验法则仍是:“到25%就该警觉。”
- 延迟与智能之间的权衡被称为“语音部署中最难解决的问题”,解决路径一边是“每次削掉 10 毫秒”,另一边则是反直觉地加入填充语。 在客户 API 需要5秒返回时,完全没有上下文填充语“反而显得更僵硬”;一句自然的“等我一下”就能遮住等待时间,瓶颈于是变成填充语听起来有多自然。
- 一位执行引擎嘉宾描述了提示词架构的钟摆式变化。 7个月前,LLM 还“持续跳过 4A1 步骤”,团队不得不按场景插入提示词;如今,负责判断相关性的那一层有时反而不如模型本身,“所以现在又回去了……倾向于把所有东西都给模型”。无论如何,诚实的方法只有一个:“测试、找出答案,再测试……这个过程永远不会结束。”
- 在高频语音场景中,成本和可靠性优势可能让自托管小模型胜过前沿 API。 一位平台嘉宾指出,通话“在开始10秒就挂断”也已经产生了巨型 prompt 的输入 token 成本;Smallest 看到客户将 GPT-4o/4.1 realtime 换成其微调 SLM Electron,成本更低、延迟“低得多”,也不再暴露于 OpenAI API 的延迟尖峰——“那些延迟你完全控制不了”。
- 这一期节目推出了 Latent Space 的第 4 档播客——Basil 聚焦 FDE 的节目——其核心建立在主持人的判断上:前置部署工程师能挖出客户的一手事实。 研究者“总想靠更大的模型解决一切”;FDE 面对的却是这样的客户:“他们犯了一个可怕的错误……你怎么保证我不会再遇到这种事?”
精读
1. Latent Space 新增第 4 档播客:Basil 的 FDE 节目,从语音代理切入
- Basil 进入前置部署工程的路径是:先在 Credit Karma 做了几年产品经理,随后加入一家小型 venture studio,之后创办咨询公司 Exaflop Labs,并于2年前开始为零售商和保险公司搭建代理。到了1月,私募股权客户不断对他说:“我不知道哪些是营销 BS,哪些不是。”于是他开始录制深度讨论圆桌;第一期聚焦 agentic engineering,嘉宾来自 Factory、Cognition、Composio 和 Sourcegraph,后续还覆盖 computer-use agents 以及企业代理。
- 为什么从语音开始?Basil 称,语音是“当前 AI 最具竞争性的市场之一”,并以 Sierra 为例。主持人的信号筛选标准很直接:pipeline 供应商夸自己的 pipeline,只能算“这不是废话吗”;但专注支持场景的从业者如果得出“模型还没到那个程度,可能永远也到不了”的结论,就值得发布。
- 主持人明确给出了自己的 FDE 判断:研究者“总想靠更大的模型解决一切”,产品工程师则试图把产品交付出去;但 FDE 直接面对客户,听到的是:“这种事绝不能再发生。你怎么保证我不会再遇到这种事?”Basil 描述的外呼现实更残酷:用户“一意识到对面是机器人就直接挂断”。
2. 语音代理入门:级联架构,以及为什么轮次切换并不简单
- 架构嘉宾的拆解是:音频通过 WebRTC、电话线路或 WebSockets 进入;转写环节前后可以选配降噪和语音隔离模型;随后进行轮次检测——“这不是对讲机,也不是按键说话”——系统利用语音活动检测和 Smart Turn 模型,区分一句话中间的停顿与真正说完,再交给 LLM 生成回复,最后由 TTS 流式返回音频。
- 护栏设计取决于呼叫方向。外呼催收是常见场景,反而更容易处理,因为机器人可以直接挂断,只需接受有限集合的输入;但 Amazon 规模的呼入意味着要覆盖10亿种商品和各不相同的政策,不能简单塞进一个 prompt,因为 LLM“总是记住开头4%和结尾4%,中间部分基本都会忘掉”。
- 主持人最值得引用的判断是:“语音 AI 领先编码代理一代……我们从第一天起就在做压缩。”早期更小的模型到 10,000 个 token 就会失控;即便上下文达到100万个 token,“到25%就该警觉”,并考虑进行上下文压缩。
3. Speech-to-speech 在演示中惊艳,企业落地仍由级联架构胜出
- 一位语音平台嘉宾给出了反对 S2S 的典型案例:一个反应迅速、情绪饱满的演示先问该预约哪天,他回答“下周”,机器人随即说:“好的,是6月10日吗?”——“不对,现在是2030年。”“你说得对,现在是2030年,那我们就安排在2030年6月10日吧。”级联架构可以把输入交给监督模型,分别处理 prompt injection 和社会工程攻击、意图选择、上下文优化以及基于事实的检查;代价则是一条工程团队花了约6个月做并行化的传送带,持续“每次削掉 10 毫秒”。
- Smallest AI 嘉宾给出了反方论据:级联架构是同步的,但大脑“在听的同时也在思考”;如果想在“人类大脑的运作方式”上通过图灵测试,就需要异步、原生语音输入/语音输出的模型。Hydra 是多模态模型,支持语音和文本输入、语音和文本输出,同时保留工具调用与护栏能力。让步之处在于,专用 STT 模型可能比 S2S encoder 更准确;企业目前仍有多得多的级联部署,而 S2S 是“最终的未来”。
- Smallest AI 预测的混合架构是:由 S2S 运行实时对话环路,遇到复杂问题时中断并交给级联链路处理——就像人类有“50%的时间”在自动驾驶式回答。随着系统进入高并发场景,还可以针对这50%的常规任务训练专用模型。
- 模型选择与行业闲谈方面,关闭 thinking 后,速度快的模型也能胜任;一位嘉宾说:“我还是喜欢 Gemini 2.5……他们发布的 3.5 更慢了”,并称 Haiku “真的非常非常好”。谈到 Sesame 那个消失的 demo,一位嘉宾说,他了解到这家公司正在做硬件,随后转述自己得到的回答:CEO 已经赚了很多钱,只是想玩玩。
4. 巨型 prompt 还是工作流图:一位执行引擎嘉宾的钟摆又摆了回来
- 一位平台嘉宾的划分是:有专线且流程可预测的呼入,适合节点/图构建器;外呼用户则可能“非常不稳定”,会感到沮丧、愤怒或恼火,因此更适合把一个 prompt 作为“中央大脑”,通过检索和余弦相似度调取任何专用流程未预先覆盖的组件。
- 这位执行引擎嘉宾改变想法的过程值得原样保留:7个月前,LLM 还“持续跳过 4A1 步骤”,所以团队构建了按场景插入规则的机制;如今,负责判断相关性的那一层有时反而比模型更差,“所以现在又回去了……倾向于把所有东西都给模型,让它大致自己判断”。
- 对非确定性系统而言,方法论底线是:按客户分别构建,用 LLM-as-judge 做评测,并接受“真正的答案很可能永远只是测试、找出结果,再测试、再找出结果,这个过程会一直持续”。
5. 延迟、成本、本地化,以及自托管 SLM 的价格优势
- 填充语不是失败,而是产品设计的一部分:人类思考时也会说几句话,因此完全没有填充语“反而显得更僵硬”;一句自然的“等我一下”,就能覆盖客户 API 工具调用所需的5秒。执行引擎嘉宾的结论是,性能与稳定性的取舍“是语音部署中最难解决的问题”。
- 一位平台嘉宾的做法包括:把步骤下放给受约束的子代理,例如在催收流程中将信用卡信息采集独立出去;并行调用小型分类模型进行意图识别;同时让组件可以随时替换。在一次日本部署中,一套对英语、西班牙语和葡萄牙语有效的语音技术,到了语音环节却“完全不起作用”,因此这套方法允许接入定制 TTS 服务器;阿拉伯语中的品牌名和地址发音同样棘手。
- 另一位平台嘉宾指出,成本问题会进一步放大延迟优势:通话大多“在开始10秒就挂断”,但巨型 prompt 的输入 token 成本此时已经产生;拆分 prompt,速度和成本都能改善。
- 讨论开源工具的嘉宾发布了 open-turn STT、LLM 和 TTS 基准,可以在本地针对新模型运行。节目还提到 Nemotron 3.5 刚刚发布,以及 NVIDIA 的 ASR 基准表现不错。FDE 可以在上线前让 Claude 基于真实客户对话“根据我们的评测套件构建一套评测”。Smallest 看到客户将 GPT-4o/4.1 realtime 换成其微调 SLM Electron:成本更低,延迟“低得多”,并可通过自托管避开 OpenAI API 的延迟尖峰——“那些延迟你完全控制不了”。