先锋 趋势 方法 投研 作者
AI Agent 如何重塑客户支持:与 Decagon 的 Jesse Zhang 对谈
返回节目精读

AI Agent 如何重塑客户支持:与 Decagon 的 Jesse Zhang 对谈

摘要

  • 客户支持正成为 AI Agent 近期的“黄金用例”,因为部署可以从小规模启动,同时节省成本和服务质量仍能直接量化。 Decagon 同时追踪自动化处理的对话占比、客户满意度、NPS 和准确率,实际上为每位客户提供跨语言、全天候在线的“口袋私人礼宾”。

  • Bilt Rewards 提供了 Decagon 最清晰的经营杠杆证明:大约1个月内,随着 AI 接管大量自动化工作,Bilt 停止扩充客服团队。 近1年后,Bilt 已重组客服职能,并量化出约65名客服的人员成本节省;客户则表示,其客服“完全不像我们以前用过的任何 AI 或聊天机器人系统”。

  • Decagon 声称的差异化来自通用模型之上的软件,而不是对 GPT-4o、GPT-4 或 Claude Sonnet 的独家访问。 其编排层围绕客户特定的业务逻辑评估并组合模型;产品层则展示数据、决策步骤、知识缺口和对话类别。Zhang 的框架是:“大部分 alpha,或者说你真正构建的大部分特殊能力,都在模型之上。”

  • 对于客服 Agent,指令遵循比 o1 和 Sonnet 时代被反复强调的编程与数学推理能力提升更重要。 客服 Agent 必须“严格按 SOP 执行”,尤其是在受监管行业;更强的推理能力有帮助,但对 Decagon 而言,可靠地遵循工作流才是更关键的模型发展方向。

  • 语音扩大了可覆盖的工作流,但也带来持续存在的延迟与计算权衡。 端到端语音模型响应很快,但生产环境中的通话可能需要检索数据并多次调用模型;语音转文字、文本处理、再转语音会增加延迟,却能完成这些工作。Decagon 的务实过渡方案包括使用“好的,请稍等一下,我正在查询您的数据”这样的对话缓冲。

  • 组织的终局并不只是减少人手,而是让更多人“监督和编辑 Agent”。 Zhang 预计,管理者将监控、纠正并硬编码无限扩展系统的行为;屏幕上下文和计算机使用能力则可能让 Agent 真正操作产品,而不只是回答问题。不过在他看来,Anthropic 展示的 computer use“还没达到生产就绪”。

  • 相较于行业演示所暗示的前景,Zhang 对大多数近期 Agent 类别“更悲观”。 成功的市场既需要在接近完美之前逐步上线,也需要容易量化的 ROI:安全 Agent 面临非确定性问题,因为任何微小异常都可能必须被捕捉;text-to-SQL 则往往仍是需要人工监控的 copilot,经济价值难以定价。更好的模型未来可能解锁这些类别。

精读

1. 客户支持为 AI Agent 提供了异常务实的切入点

  • 将自己的第一家公司卖给 Niantic 后,Zhang 与 Ashwin 探索 AI Agent 时没有过度设计这套命题:他们此前最大的经验是,创业者“不能把事情想得太复杂”。与客户交流后,他们将客户服务确定为“黄金用例”。

  • Decagon 成立于2023年8月,目前已为 Rippling、Notion、Duolingo、Eventbrite、Vanta、Substack 和 Bilt Rewards 等公司的客服运营提供服务。反复使用的评估框架很直接:AI 能完成多少工作,客户满意度提升了多少,以及——尤其是在受监管行业——准确率有多高。

2. Bilt 将指数级增长的客服需求转化为可见的人员杠杆

  • Elad Gil 引用了 Klarna 的案例。Klarna 是一家欧洲先享后付服务商,数据来自其 CEO 在 X 上发布的帖子:4周内处理230万次聊天,客户满意度与人工相当,相比人工重复咨询减少25%,解决问题平均用时2分钟,而人工客服需要11分钟。帖子还称,Klarna 已覆盖23个市场、35种语言,并提供7×24小时服务。Gil 表示,他认为 Klarna 已将700名全职客服转去从事其他工作。

  • 在 Bilt,Zhang 的因果链条很简单:咨询量大致随用户数线性增长,因此用户规模“基本呈指数增长”就会带来相应的客服压力。最初的诉求非常直接:“天啊,这么大的量把我们压垮了。AI 能不能帮忙?”

  • 大约1个月内,随着 Decagon 自动化处理更多工作,Bilt 停止扩充客服团队。近1年后,Bilt 已重组客服职能,并量化出约65名客服的人员成本节省——这是很容易表达的 ROI,同时还带来了更快的服务速度和社交媒体上的正面评价。

3. 可防御的产品建立在共享基础模型之上

  • Zhang 将 Decagon 视为一家软件公司,因为所有人都能访问相同的 GPT-4o、GPT-4 和 Claude Sonnet 模型。差异化来自“编排层,或者说围绕模型的软件”,而不是底层模型本身。

  • 编排意味着评估每项任务最适合由哪个模型处理,将这些模型组合起来,再围绕客户的业务逻辑塑造最终系统。周边软件让决策过程可检查:用户可以看到系统参考了哪些数据、采取了哪些步骤、生成了什么答案,并提供反馈。

  • 在大规模运行时,LLM 可以读取100万段人工团队无法逐一审阅的对话,发现知识缺口、划分需求类别,并汇报整体运行情况。买方可以用人工表现和业务指标对质量进行基准测试,再让 Agent 先处理1%的流量,逐步扩大规模——也可以同时测试另一种方案。Zhang 认为,可观测性、可解释性和控制能力是 Decagon 取得效果的关键。

4. 指令遵循与语音延迟成为下一阶段约束

  • 近期围绕 o1 和 Sonnet 的进展,重点集中在定量推理、编程和数学能力,但 Zhang 表示,这些并不是 Decagon 面临的最大瓶颈。客户支持依赖指令遵循:给定一套 SOP 或工作流,Agent 能否“严格按要求执行”?

  • 语音只是通过另一条渠道处理同一个客户互动问题。随着 ElevenLabs、OpenAI 和 Cartesia 提升语音的真实感与响应速度,Decagon 的客户正在测试语音 Agent;Zhang 的更大范围职责覆盖聊天、电子邮件、SMS 和电话,因为“渠道本身并不重要”,底层请求才重要。

  • 延迟仍是核心问题。端到端语音响应很快,但生产环境中的客服可能需要检索数据并多次调用模型;先转录、再用文本完成计算、最后重新生成语音则更慢。团队可以流式输出,或使用“好的,请稍等一下,我正在查询您的数据”这样的对话缓冲。Decagon 会围绕每个客户的优先级做出这些权衡。

5. 人的参与仍是经营杠杆的重要来源

  • Zhang 预计 Agent 数量会出现“合理的爆发式增长”,尽管部分用例需要更长时间才能落地。因此,客服工作会转向由人来监督和编辑 Agent,管理者负责监控行为、纠正偏差,并保留可见性和控制权。

  • 监督 AI 与管理员工不同:Agent 可以无限扩展,部分行为还可以直接硬编码。Zhang 认为,实时纠正的交互界面仍有很大改进空间,例如可以直接告诉 Agent:“你刚才这件事做错了。下次请这样做。”

  • 他的创始人网络也提供了另一种人的优势。过去5、6年里,参加数学和编程竞赛的同行从学术界或量化交易转向创业,随后在非正式层面交叉投资,并共享招聘、销售和薪酬数据。Zhang 认为,竞赛经历是“相当不错的信号”,但 Decagon 的招聘流程总体并无不同,也不要求候选人具备这类背景。

6. 渐进式上线与清晰 ROI,区分出可持续市场与演示效果

  • Zhang 表示,按照当前模型的发展阶段,绝大多数用例都不会实现真正的商业化应用。Decagon 刚开始时,他并不知道未来12或24个月内是否会出现真实用例;事后看来,他认为成功的用例需要渐进式上线,并且 ROI 可量化。

  • 安全领域体现了可靠性问题:AI 看起来很适合处理包含海量日志的环境,但实际工作可能要求捕捉每一个微小异常。由于生成式模型天然具有非确定性,Zhang 预计,企业采用 Agent 化安全系统的速度会“非常、非常、非常慢”。

  • text-to-SQL 体现了经济性问题。买方可能喜欢生成结果,但仍需要有人监控和编辑,最终 Agent 变成了 copilot;由于大多数团队并没有那么多数据科学家,替代价值难以基准衡量,也很难据此证明大额合同的合理性。

  • 近期真正胜出的模式,将编程 Agent 式的任务拆分与客服式的效果衡量结合起来:在边界明确的工作上部署,在达到完美之前先交付价值,并量化回报。Zhang 仍对许多当前类别持悲观看法,但也保留了这一判断:“随着模型改进,它们将解锁大量新的用例。”