先锋 趋势 方法 投研 作者
137: Agent 是机会,造 Agent 的工具也是|从OpenAI开发者日聊起|Agent#6
返回节目精读

137: Agent 是机会,造 Agent 的工具也是|从OpenAI开发者日聊起|Agent#6

摘要

  • OpenAI 正把 Agent 的构建、部署、评估与优化压缩成一条标准化生产链。 Agent Builder 用拖拽式 workflow 编排 classifier 和 if/else,ChatKit 解决前端交付,datasets、trace grading、prompt 优化与 reinforcement fine-tuning 构成反馈闭环;Henry 的概括是,OpenAI “练出了一身武功,然后想把它传授给广大的开发者”。这会降低企业落地门槛,也可能让原本属于 Agent 创业公司的部分性能护城河逐渐标准化。

  • Apps in ChatGPT 的核心资产不是新 UI,而是 8 亿周活带来的操作系统级分发。 相比 2023 年多数只是“prompt 的包装”的 GPTs,新 Apps SDK 基于 MCP,加入 OAuth-style 授权、外部工具与交互组件,使 Canva、Figma 等应用能提供更完整的应用体验;但商业分成仍处实验期,所谓未来抽成 30% 只是类比 iOS 的推测。开发者同时面对数据与留存不对称:“有点像在别人家的地基上建房。”

  • Agent Builder 暴露了 OpenAI 商业化与 AGI 路线之间的真实张力。 AGI 路线希望模型吞掉人工写死的流程,Claude Code 式通用 Agent 会随底层模型升级直接变强;Agent Builder 却把流程画成图,优点是安全、可解释、今天就能卖给大客户。Henry 称其为一次“非常务实的转身”:OpenAI 既要追自主智能体,也要用当前企业收入支撑约 5,000 亿美元估值及更大的野心。

  • Agent Tooling 可能从约 200 亿—300 亿美元的 DevTools 子市场,跃迁为长期 2,000 亿—5,000 亿美元市场。 嘉宾的推演以全球约 6,500 亿美元软件收入、DevTools 占中低个位数百分比为起点,再引用软件因吞入服务业而可能扩至 10 万亿美元的判断;若工具层占新市场约 5%,规模可增长 10—15 倍。最有机会的不是工具拼盘,而是卡住身份、通信、观测或评估节点,并形成“越用通过率越高、成本越低”的数据闭环。

  • 工具生态正在从“能调用”转向“能完成任务”,Composio 是这一迁移的典型样本。 它用 Agent 自动编写、修复 MCP server,再以 Rube 充当“one MCP server to rule them all”,让 Cursor 根据任务从数百个 server 中选工具;这既缓解上下文和 token 压力,也把可靠执行变成产品。MCP 更适合高成功率、尤其带写操作的关键流程,browser use 则补足未开放接口的长尾网站,二者更可能长期共存。

  • 语音已经出现可量化的基础设施放大效应,LiveKit 一年内从每天承载约 100 万次语音通话增至 2,000 万次。 它不主要生产语音模型,而是承载实时音视频、turn detection 与 orchestration;其客户覆盖 Character.AI、Grok,并称支撑约 25% 的 911 traffic、平均每周帮助抢救一条生命。终局被判断为 speech-to-speech,但可插入 guardrails、成本和行为更可控的 STT→LLM→TTS cascade 仍有明确商业寿命。

  • Evals 与记忆不是附属功能,而是 Agent 从 demo 进入生产环境的控制层。 一个较大客户仍可能只让工程师试打三四通电话就发布,原因是标注数据昂贵、团队难对评分集达成共识,主观复杂任务又比 coding、数学更难验证;OpenAI 以 11 亿美元收购 Statsig,说明 A/B testing、灰度发布和指标闭环正在内建化。Letta 的 “sleep-time compute” 则代表另一条路径:Agent 在无人交互时花 token 整理长期记忆,把状态持续转化为可复用能力。

精读

1. AgentKit 把 Agent 开发闭环变成了一套标准件

  • Henry 对发布的总括是,OpenAI “自己练出了一身武功,然后现在想把它传授给广大的开发者”:AgentKit 覆盖 build、deploy、monitor、evaluate 和 optimize,而不是只提供一个模型 API。

  • Agent Builder 是可视化编排器;发布现场在八分钟内从零拖拽出一个生产级别的 Agent。演示先做 classifier,再接 if/else,分别调用不同 Agent,本质仍是“完全人类手工来 craft”工作流。

  • ChatKit 补齐前端 UI SDK,让开发者能嵌入聊天组件;上线后则由 datasets、trace grading、自动 prompt 优化和 reinforcement fine-tuning 接力,形成从用户交互到模型改进的闭环。

  • 所谓 trace,是用户提出需求直至成功或失败的完整执行轨迹;trace grading 可用规则函数,也可用 LLM-as-a-Judge,给步骤打标签、评分并定位问题。

2. 可视化 Builder 的价值在企业普及,而非技术新颖性

  • 曼祺追问它是否类似 Dify、扣子、n8n 或 Zapier,Henry 的回答基本肯定:OpenAI 的 UI/UX 或许更细致,但尚未形成足够大的机制差异,这也是部分开发者失望的原因。

  • 硅谷开发者已习惯用 Claude Code、Codex 直接 build Agent,拖拉拽不会显著改变他们的工作流;真正的增量用户是企业里“不那么 technical”的业务人员,他们需要安全、清晰、容易解释的流程。

  • 这也意味着部分 Agent 公司的差异化会被标准化。过去持续评估和调优可能是单家公司把 Agent 做得更好的护城河,现在 OpenAI 把 datasets、trace grading 与 reinforcement fine-tuning 打包提供。

3. Agent Builder 与 AGI 自主路线存在方向性张力

  • Henry 保留了批评者的核心质疑:AGI 路线希望把人手写死的步骤“吃到模型里面”,让一个有状态智能体自主规划、连续使用工具;Agent Builder 却把流程画成图,再交给模型执行,两者“甚至是有点相反的”。

  • Claude Code 代表通用 Agent 路线:尽量让智能体自己跑、少画流程图,底层模型一升级,整个 Agent 直接受益。Agent Builder 则承认“我现在可能等不到未来模型更好”,先满足当下企业需求。

  • 这种产品对追求 AGI 的 researcher “并不 sexy”,但对大客户很安全、好理解、能落地,所以 Henry 判断“最后应该能买单”。它不是技术终局,却可能是商业化的近路。

  • 曼祺提醒,OpenAI 其实两条路都做了,另有代码式 Agents SDK;Henry 的回应是 Sam Altman 可能“什么都要”,组织变大后容许分叉,估值和 revenue 压力也要求务实产品。

4. Apps in ChatGPT 终于不再只是 prompt 商店

  • 2023 年 custom GPTs 的主要问题,是大量产品最终只剩“prompt 的一个模板加上一个自定义 logo”;它们不能可靠调用第三方服务、保存状态、发送通知或执行完整工作流,GPT Store 因而“雷声大雨点小”。

  • 这次 Apps SDK 基于 MCP,并加入 OAuth-style 授权、外部工具调用和 interactive UI;配合 eval、versioning 与 ChatKit 的 building blocks,开发者才真正拥有构建完整应用体验的工具箱,而非“prompt 的包装”。

  • Canva 的前后对比最清楚:旧版也能生成图片,新版可以绑定并授权 Canva 账号,把用户原有资料带入生成流程。Canva、Figma 等 launch partners,也把首批应用的质量门槛抬高。

5. 8 亿周活给了新生态操作系统级分发

  • Henry 认为最直接的红利是分发:ChatGPT 已有约 8 亿周活,一个优质 App 可立即触达大量用户,不必独自解决冷启动;对需要安全与合规背书的初创公司,这个平台也可能降低进入大企业的信任成本。

  • 与两年前 GPTs 缺乏赚钱案例相比,这次开发者激励可能更直接。但发布时如何收费、分成或引入广告仍很模糊,Henry 提到未来可能抽 30%,明确只是参照 iOS 模式的猜测。

  • “ChatGPT 有潜力变成一个操作系统”不只是口号:Apps SDK 让文字对话中直接出现近似原生 App 的交互组件,用户无需离开 ChatGPT 即可授权、操作和完成任务。

6. OpenAI 用内部企业实践反向打磨 AgentKit

  • Henry 判断 OpenAI 不会放弃 To B:Anthropic 与 Google 正积极争夺 Enterprise 和开发者市场,OpenAI 内部也成立 Future of Work 团队,推进客服、合同审核、数据分析和商业线索转化。

  • “OpenAI on OpenAI”的做法,是把销售、成交、客服和 customer success 全流程先在自己内部用 AI 跑一遍,再把经验沉淀成工具。AgentKit 因而不只是实验室产品,也是内部生产实践的外溢。

  • 一个具体数字是,OpenAI 每月约有 13,000 条销售线索,过去人力只能为约 1,000 条提供相对个性化的回复;引入 AI 后,覆盖效率大幅提高。

  • 客服 Agent 会查询内部知识库与政策库;服务过程中的 trace grading 可能反过来反馈到这些库。Henry 的因果链是:“自己 build 的 Agent 多了”,评估与开发工具自然也磨得更好。

7. 企业数据也是模型竞争不能放弃的燃料

  • Henry 对 To B 的论证不止收入:模型的 intelligence 是多维的,缺少企业场景数据,就难以改进不同业务维度;这些缺口最终也会伤害 ChatGPT 的 productivity use cases。

  • OpenAI 同时投入基础模型、Sora 2 对应 App、开发者平台和企业 Agent,也引发了这些投入是否会影响追求 AGI 速度的讨论;但公司已扩至数千人,选择是并行扩张而不是单线押注。

  • 对“too big to fail”的讨论,Henry 同意 OpenAI 可能已处于大而不能倒的状态;不过约 5,000 亿美元估值未必满足 Sam Altman,若还要上一个数量级,就仍需实际商业价值支撑。

8. 平台红利伴随数据、留存与自营三重风险

  • 首个不对称是数据:Apps 的上下文和用户行为主要留在 ChatGPT 环境,开发者得到的可能只是有限调用信息,难以建立直接用户关系、分析行为或优化留存。“有点像在别人家的地基上建房。”

  • 第二个风险是平台亲自下场。OpenAI 已覆盖销售、转化、客服等 To B 流程,又掌握完整对话历史,平台上出现的大机会可能被它内建或直接吃掉。

  • 曼祺拿 Google 作对照:开发者也担心 Google 看见好应用后复制,但通常认为大公司的产品速度追不上 startup;OpenAI 执行更快,因此更令人忌惮,这反过来也可能削弱其平台中立性。

  • 目前 Agent Builder 基本只能使用 OpenAI 模型,eval 才可引入第三方模型。Henry 认为,若 Apps in ChatGPT 真要成为主要平台,长期应放开模型和工具选择,把自身定位收敛到平台层。

9. 流量入口可能集中于 ChatGPT 与 Gemini

  • Henry 判断平台数量最终取决于“大流量入口”有几个,目前最显著的是 ChatGPT 和 Gemini。Gemini 若按全平台统计,用户量据称已超过 ChatGPT,但其中可能包含 Gmail 内调用等口径。

  • Gemini 的追赶势头仍值得重视,AI Studio 的开发功能持续完善;OpenAI 则借 Dev Day 集中补上 Agent 开发链,两边推进速度都很快。

  • Anthropic 的位置不同:Claude 尚不是同等级大众入口,MCP 又是所有模型都能采用的开放标准。Henry 因而不认为 MCP 自动给 Anthropic 带来强 competitive advantage,尽管它显著增强了整个生态。

10. Agent Tooling 是虚拟数字人的身体与教练

  • Henry 把 AGI 定义成一种“虚拟数字人”:过去是人学习鼠标、键盘来适应机器,未来则是计算机适应人,人机交互逐渐变成以自然对话为基础的“人人交互”。

  • 大模型只是聪明的大脑;LangChain 是协调与调度能力的骨架,MCP 是调用工具的左手,browser use 是操作网页的右手,ElevenLabs 是嘴,LiveKit 则提供能听、能看的实时感知基础设施。

  • Braintrust、Galileo 等 eval 公司更像教练:它们不直接组成身体,却持续观察 Agent 的表现、发现失败并推动改进,使其从能演示走向可靠执行。

11. 六次模型跃迁逐步催生了完整工具生态

  • 第一波始于 2022 年底 ChatGPT 与 GPT-3.5:开发者发现会聊天还不够,还需连接外部数据、管理上下文并组合多次 LLM 调用,于是 LangChain 式脚手架出现;当时这些产品还被叫作“大模型应用”。

  • 第二波是 2023 年 6 月 OpenAI Function Calling。模型开始按上下文调用外围工具,Henry 甚至夸张地说,早期写 Agent “百分之八九十的时间”都花在写一个好工具上。

  • 2024 年 11 月 Anthropic 发布 MCP,使工具能在不同模型间复用,原有工具提供商也纷纷转为 MCP server 提供商。Henry 把它称作 Anthropic 送给社区和 AI ecosystem 的“一份礼物和慈善”。

  • 第三、第四波分别来自 2024 年 5 月 GPT-4o Advanced Voice Mode 与 2024 年 6 月 Claude Sonnet 3.5:前者拉动 LiveKit,后者让 Cursor 式 AI coding 起飞,并催生 E2B、Daytona 等安全代码沙盒。

12. 推理与 computer use 把 Agent 从脚本推向自主执行

  • 第五波是 2024 年 9 月 o1-preview。推理能力让 Agent 能自己规划多步任务和工具顺序,也让 reinforcement learning 微调服务及 Braintrust、Galileo 等复杂任务评估变得更重要。

  • 第六波是 2024 年 10 月 Anthropic computer use,之后还有 OpenAI Operator。围绕浏览器操作,出现 Browserbase、Anchor Browser 等云浏览器基础设施,以及直接接受“帮我订个外卖”这类自然语言任务的上层 API。

  • Henry 坦承,预测未来三到六个月“非常非常难”;相对确定的是所有模型厂商都会加强推理与 tool use,语音继续获得投入,多模态进一步融合,讨论中以 Nano Banana 式图像编辑模型为例。

13. 资本已经同时下注嘴、骨架与教练层

  • Naomi 列出的第一个信号是 ElevenLabs 员工约 1 亿美元 secondary sale,对应约 66 亿美元估值;距离上轮融资仅九个月,估值约翻倍,显示语音基础设施的 adoption 与商业化都在加速。

  • LangChain 正 closing 一笔约 1 亿美元融资,由 IVP 领投,估值约 11 亿美元。资本持续加注 Agent framework 与开发者基础设施,而非只追逐终端应用。

  • OpenAI 以约 11 亿美元收购 Statsig,把 A/B testing、灰度发布和数据指标闭环由外挂工具变成内置组件。两位观察到,越来越多过去做 A/B test 的人正在转向做 eval。

14. Composio 把 MCP 从工具目录推进到任务完成层

  • Naomi 的底层判断是,行业正从“工具调用的时代”进入 “task completion 的时代”。Composio 不只提供大量 MCP server,还试图确保 Agent 能更可靠地执行任务,像一套技能层或操作系统。

  • 产品一端是供开发者编程接入的 MCP 平台,另一端是 prosumer 产品 Rube。其口号借用《魔戒》:“One MCP Server to Rule Them All”,由一个 Meta MCP 根据任务选择正确 server。

  • Henry 记得 Cursor 同时点亮的 MCP server 数量大约只有三个,但特意保留了“具体数字可能需要确认”的限定。每个 server 又暴露多个工具和大量参数,全部塞入上下文会非常吃 token。

  • 工具数量存在 trade-off:Gmail 之类复杂产品可能需要暴露很多能力,但两个功能过于相近,模型就会困惑“到底调用哪个”,进而降低执行成功率。

15. Composio 的壁垒来自先做 Agent、再让 Agent 造工具

  • Composio 约在 2023 年 7 月成立于印度,最初想做类似集成型 Devin 的产品,用 AI 自动生成第三方 API 集成代码;当时模型准确率不够,团队发现更底层的问题是 Agent 无法稳定调用工具。

  • 它在 MCP 发布前便 pivot,不再把重点放在集成自动化,而是把通用工具封装成 LLM 可直接调用的技能层。今天高质量 server 的生产与改进,本身也由 Agent 自动完成。

  • 这个资源有限的团队靠 Twitter 演示、Reddit 和 Discord 反馈、亲手调试集成需求建立口碑,随后获得 Lightspeed 领投的 Series A,并积累 ClickUp、Glean 等客户。

  • 团队目前约 30 人,整体从印度搬到旧金山,以便贴近 Agent 客户。Naomi 称自己尚未见过其非印度员工;团队追求的是“最 scrappy”“最 hungry”的人,而非搬到美国后刻意本地化招聘。

16. Anthropic 没必要亲自维护一个完整 Composio

  • 曼祺的质疑是:既然 MCP 来自 Anthropic,为何不自己做集成 marketplace?Naomi 认为,维护分散的第三方 API 并不会增强其模型能力或安全性等核心护城河,反而会消耗大量人力。

  • Naomi 补充,底层平台也希望保持相对中立。开放协议扩大 Claude 可使用的工具生态即可,未必需要把所有 server 的工程维护和客户支持收入囊中。

  • Composio 能成立的空隙,正来自这种分工:模型公司定义接口,专门团队承担分散的第三方 API 维护,以及工具调用中的错误处理和可靠执行。

17. MCP 与 browser use 会因可靠性差异长期共存

  • 在 OSWorld、WebArena 等 benchmark 上,嘉宾口述最好的 desktop 或 browser 模型成功率约为 60%—70%。Henry 用医疗 onboarding 反问:关键流程若只有 70% 成功率,“我觉得是完全不可行的”。

  • 因此短期内,高风险和写操作更依赖可靠 tool use。随着 reasoning 与工具使用增强,Agent 才可能避免“小孩挥大刀”,从目前常见的 read-only research 逐步进入真正执行。

  • browser use 的价值在未被 MCP 覆盖的长尾:日本不少 boutique 酒店未接 OTA,有团队用浏览器遍历日期组合、抓取空房,再供搜索引擎检索。这类非标准网站不值得逐一建设正式接口。

  • Henry 的终局比喻是:“ChatGPT 的最终目标是 WeChatGPT。”若它成为承载缴费和各类服务的 super app,服务商接入 LLM 接口可能不再是愿不愿意,而是面对“难以抗衡的大潮流”。

18. 语音市场已经出现基础设施级增长

  • Henry 口述全球每天有 “one trillion”的电话;他的重点是其中大量是商业电话、客服与预约可以由 AI 处理,另有 personal assistant 和情感陪伴两类快速增长需求。

  • LiveKit 一年前每天承载约 100 万次语音通话,录制时已达到约 2,000 万次,一年增长 20 倍。它始于疫情期 WebRTC 实时音视频传输,最初与 AI 关系不大。

  • GPT-4o 采用其传输基础设施后,LiveKit 获得第一波 AI 爆发,并从底层逐步向上扩展:SDK 已能协助构建 voice Agent,处理 turn detection 与 orchestration。

  • 这与 ElevenLabs 的定位不同:后者最初更像语音模型公司,LiveKit 则是承载多模型、多场景的实时通信基础设施,类似声网但也提供 Agent 平台。

19. 911 案例说明实时通信不只是客服降本

  • LiveKit 据称承载约 25% 的 911 traffic:报警者接到短信后打开链接,即可把手机画面和声音实时传给接线员,让对方看到现场而非只依赖口述。

  • 紧急情况下,系统还能引入远程心肺复苏教练,根据实时画面指导操作。Henry 提到,这套基础设施平均“每周能抢救一条人命回来”。

  • Character.AI 与 Grok 的语音也由 LiveKit 承载,但 “powered by LiveKit” 指通信和 Agent 基础设施,不代表语音模型来自 LiveKit。

  • 录制时即将公布的合作是 Salesforce:其 Agentforce 客服 voice Agent 将运行在 LiveKit Agent 平台。平台同时支持 OpenAI、ElevenLabs、Cartesia 等模型。

20. Speech-to-speech 是终局,cascade 仍是现实最优解

  • cascade voice Agent 先做 STT,再把文本交给 LLM,最后以 TTS 输出;speech-to-speech 则像 OpenAI GPT Realtime,直接从语音输入返回语音,两种架构都能运行在 LiveKit 上。

  • Henry 的大判断很明确:“终局一定是 speech-to-speech。”端到端模型能把笑声、情绪、语调和中途切换语言都保留在 context 中,交互也更接近人。

  • 但 cascade 当前可控性更好:开发者能在字符串阶段加入 guardrails 和判断。医院信息收集等场景并不需要 AI 伪装成人,适度的机械感反而可能更合适。

  • 语音投入仍在加强:David AI 为顶级实验室提供语音数据,最近几个月内完成约 2,500 万美元的 Series A;OpenAI GPT Realtime API 正式版已于去年 10 月发布,这次发布的是 2.0 版本。

21. 语音竞争形成多强格局,Anthropic 暂不在牌桌上

  • 嘉宾观察到 OpenAI、Google、Grok 都在加码语音,而 Anthropic “可能没有在牌桌上”,更像 all in coding。

  • 新版 GPT Realtime 的改进集中在更像人的音色与表达、更好遵循“温情”或“职业化”等提示,以及理解笑声、情绪和说话中途换语言。

  • 国内开发者广泛采用 MiniMax、豆包语音,播客生成类 Agent 也在增加。Henry 判断中国语音生成模型具备领先实力,并提到 MiniMax 在 Artificial Analysis 榜单上排名靠前,甚至可能在 ElevenLabs 之前,但海外传播仍不足。

22. Agent 记忆至少包含四种不同产品需求

  • 情景记忆让客服记得“上周已经尝试方案 X”,避免重复操作并保持连续性;这不是简单保存聊天记录,而是提取对下一次任务有用的经历。

  • 流程记忆保存完成任务的路径,例如 DevOps Agent 记得上次部署在第三步失败,从而避开错误步骤、复用有效路径,适用于企业自动化和多步 Agent。

  • 知识性记忆保存事实与规则,例如购物 Agent 查询折扣规则库,以减少凭空编造优惠条件的幻觉。

  • 角色或人格记忆维持 AI 男友、AI 女友等陪伴产品的交流风格,避免 out of character。企业 Agent 未必需要人格,却可能同时依赖流程与知识记忆。

23. Letta 用 sleep-time compute 把空闲时间变成学习时间

  • Letta 由两位 Berkeley PhD 创立,目标是帮助开发者构建 stateful Agent。其标志性概念不是 test-time compute,而是 “sleep-time compute”。

  • Henry 的类比是,人白天开了很多会,晚上再回忆和处理,形成 insights;Letta 让系统在无人查询时“睡觉的时候去花 token”,整理旧交互并沉淀最有用的知识。

  • 开发者需定义记忆 schema,例如身份、偏好、生日;Letta 读取对话后自动更新字段,并在未来需要时把相关记忆塞回上下文,因此确实需要接触交互内容。

  • 垂直 Agent 早期会“八仙过海,各显其能”地自建记忆;Henry 预计方法成熟后会出现标准化产品,替开发者处理脏活累活,但数据敏感性与客户愿意开放多少内容仍取决于场景。

24. 记忆最终仍是 context engineering 的一部分

  • OpenAI 自身记忆功能也在进化:一句“妈妈在生日给我做了我最喜欢的提拉米苏”,现在可能拆成姓名、生日、喜欢提拉米苏及具体事件,而不是原句整体存储,后续检索因而更准确。

  • 大模型能力与长期记忆仍是两条路线;模型可以扩大上下文窗口,但上下文“不是免费的午餐”,成本和性能都会随长度增加而恶化。

  • Henry 将 context engineering 概括为决定“什么信息应该进入上下文,什么不应该”。内循环处理当前生成所需信息,外循环则长期改进选择正确信息的能力。

  • 记忆必须在使用时进入 context,所以它属于上下文工程;对现阶段模型而言,长期记忆更像“外接的硬盘”,而非已经内生于参数的大脑功能。

25. Evals 的悖论是人人承认重要,几乎没人认真做

  • Henry 的原话是:“大部分人都会认为评估或者说 eval 这个事情很重要,但是大部分公司现在都不会好好地去做 eval。”生产实践与口头重视之间存在巨大缺口。

  • LiveKit 某大型客户的客服 Agent 容易提前挂电话,团队只在 prompt 加一句“不要那么早挂电话”,再由工程师试打三四通;感觉挂得晚了一点,就直接部署到 production。

  • 更可靠的流程应在上线前让新版本跑数百通电话,覆盖不同情景和数据集,再分析 logs、确认指标确有改善。这个案例也说明,把 eval 组件加入 voice Agent 平台很重要。

26. 评估难点既在数据,也在组织共识

  • 做 eval 首先要有人工标注或精心构造的数据集;任务越复杂,成本越高。更棘手的是,开发团队未必认同数据集代表真实质量。

  • Henry 见过团队花很久建好评测集,结果显示新版变好,成员却说“虽然数据集说我变好了,但我感觉它变差了”。没有共识的指标无法成为发布门槛。

  • coding 和数学适合 reinforcement learning,因为答案或测试信号相对明确;主观性高、链路复杂的任务可能“评估它比做出任务花的时间还多”,也是通用 Agent eval 的核心难题。

  • OpenAI 将 datasets、trace grading、prompt 优化和 reinforcement fine-tuning 串联,再收购 Statsig,方向正是把评估从一次性测试变成持续的产品与训练闭环。

27. Agent Tooling 的长期市场可能比传统 DevTools 大一个数量级

  • 嘉宾给出的基准是全球软件市场每年约 6,500 亿美元,传统 DevTools 约占中低个位数百分比,对应约 200 亿—300 亿美元。

  • 讨论中引用的行业推演认为,AI 能把人力服务转成软件服务,将软件市场天花板推到约 10 万亿美元;关键变化不是瓜分现有软件预算,而是切入更大的服务业蛋糕。

  • 若 Agent Tooling 约占新市场 5%,长期规模可能达到 2,000 亿—5,000 亿美元,相比现有开发工具市场约增长 10—15 倍。这个估算是 ballpark,而非短期收入预测。

28. 百亿美元公司将从关键工作流与数据闭环中长出

  • 传统基准包括 Okta 年收入约 20 亿美元、Twilio 约 40 亿美元、Datadog 超过 20 亿美元;Agent 经济会重写身份、通信和 observability 的对象与工作量。

  • 新需求包括 Agent 身份与调度、行为链路回放、实时低延迟通信,以及 autonomous coding 带来的代码审计、回归测试和安全执行。Braintrust、LiveKit、Composio 分别卡在其中不同节点。

  • 并非所有旧巨头都会被颠覆;真正的范式机会出现在传统 CPU、内存等指标无法描述的新行为层,例如需要解释 Agent 为什么选择某工具、在哪一步偏航。

  • 嘉宾回应的关键标准是能否形成自己的数据闭环并卡住工作流节点:产品能否做到“越用越好、通过率越高、成本越低”。

29. 旧金山生态用高频反馈把工具公司推向产品市场匹配

  • AGI House 通过 researcher paper reading、技术讨论和大型 hackathon,把顶级实验室研究者、工程师与 Agent Tooling 公司聚在一起;创业公司既获得 marketing,也得到一线产品反馈。

  • Composio 的投资判断就来自多场 Agent Build Day:社区反馈认为它相对可靠。社区信号先于正式财务数据,让投资者能观察 bottom-up adoption。

  • 旧金山正在重新活跃,OpenAI、Anthropic 办公室均在市内;嘉宾称当地租金当年好像上涨约 20%—30%。不少原在半岛或海外的团队也选择搬近客户和人才。

30. 华人创业者的产品力与执行力正在硅谷形成互补优势

  • Naomi 称录制当年从中国赴美的团队“非常多”。HF0 过去三四届约有 20%—30% 的 founding team 来自中国背景;每届约十家公司,只收 serial entrepreneur,名单不公开但会定向邀请投资人参加 Demo Day。

  • 她观察到这些团队常先在中国创业,再借美国 accelerator 建立 connection 和增长渠道;相较 YC,团队、产品与估值可能更成熟。

  • Henry 认为华人创业者在 To C 产品 sense 和执行力上有优势。垂直 Agent 的护城河通常只有两项:行业专家知识,以及“纯执行力”;后者正是中国团队的传统强项。

  • 硅谷 To B 生存环境好、收购退出路径清晰,因此创业者密集;中国团队更擅长 To C,甚至硬件,并可能带来当地投资者稀缺的“大体量消费应用”野心,形成中美互补。

31. RL 的第二春正在创造两类新工具公司

  • Henry 把近期技术社区的另一条主线称作“RL 的第二春”,起点可追溯到此前约九月或 DeepSeek 发布之后;强化学习不再只属于基础模型实验室。

  • 第一类公司构建 RL environment,卖给训练基础模型的实验室;第二类提供 RL-as-a-Service,帮助大企业改进内部模型与 Agent 在具体业务场景中的能力。

  • 这与整期讨论形成闭环:模型推理越强,Agent 能承担的任务越复杂;任务越复杂,对工具、环境、记忆、评估和可靠执行的需求就越大,“造 Agent 的工具”因而成为与 Agent 应用并行的机会。