先锋 趋势 方法 投研 作者
DevDay 2025:Apps SDK、Agent Kit、MCP、Codex,以及为什么 Prompting 比以往任何时候都更重要
返回节目精读

DevDay 2025:Apps SDK、Agent Kit、MCP、Codex,以及为什么 Prompting 比以往任何时候都更重要

摘要

  • Apps SDK 正在把 ChatGPT 从附着于其他产品的聊天机器人,变成这些产品运行其中的分发层。 OpenAI 披露开发者数量已达400万,Sherwin Wu 回忆 ChatGPT 每周活跃用户约8亿,称其规模约相当于全球第五或第六大网站。插件时代的教训是,只有分发还不够:开发者必须“真正拥有并掌控体验”,包括界面和品牌。

  • OpenAI 采用了已经开始形成的通用协议 MCP。 Sherwin 认为 Anthropic 真正把 MCP 做成了开放协议,包括让 OpenAI 参与其指导委员会;讨论显示,MCP 大约在3月与 Agents SDK 和 Responses API 同步获得采用。尚未解决的是连接器质量:第一方同步连接器可以实现索引和重排,第三方 MCP server 覆盖长尾需求,但性能取决于各创建者的 API 形态。

  • AgentKit 正在从又一个 agent 演示框架,变成端到端的生产平台。 Agent Builder、Agents SDK、Connector Registry、ChatKit 和评测工具把可视化工作流设计、部署、测试与优化串成一体;Christina Huang 在8分钟的演示时段内搭建了一个可运行的 DevDay 助手。更深层的机会在于复杂编排——涵盖“持续数周”的人工决策、可复用的企业模板,以及未来从画布走向代码、再由代码回到画布。

  • Agent 评测仍处于早期,但优化单位正从单个答案转向完整轨迹。 Christina 估计,OpenAI 目前只完成了“所需进展的大约10%”:现有系统可以评估长轨迹,但评测一个20分钟的任务,需要拆解并改进其中的单个步骤,而且往往需要人工复核。通过接入 OpenRouter,评测产品还可以在同一处比较非 OpenAI 模型和开源模型。

  • Prompting 正在成为持久的生产资产,实质上是一种“零梯度”微调,而不是随着模型进步消失。 OpenAI 围绕 GPT-5 推出了大规模自动提示词优化功能,因为每个模型都有新的行为特征,并计划把提示词、agents 和评测反馈接入持续生成改进建议的闭环。Sherwin 明确改变了此前的判断:人们曾以为“prompting 要消失了。不”;但它实际上已经“越来越根深蒂固”。

  • ChatKit 减少了前端工作,但身份体系、推理成本承担方式和 widget 生态仍未定型。 它的常驻 iframe 和 widgets 借鉴 Stripe Elements 或 Checkout 的理念:OpenAI 维护新的推理能力和多模态 UX,开发者负责定制应用本身。当前不支持自带 key,复制粘贴 key 是“巨大的安全隐患”;即使推理价格下降,总支出也可能上升,因为需求增长更快。

  • Codex 已在压缩开发周期,而 API 可靠性正成为一项可见的产品承诺。 Christina 说实习生会以“完全 YOLO 模式”使用 Codex,宽泛任务约有30%–40%的概率一次完成;可视化 Agent Builder 在发布前不到2个月才启动,“没有 Codex 不可能做到”,但人类仍会复核其工作。在服务规模上,OpenAI 已超过此前提到的每分钟60亿 tokens,并开始披露组织级吞吐量和错误 SLO;从三个9到五个9的路径,需要“指数级更多的工作”。

精读

1. ChatGPT 成为应用层

  • Sherwin 的战略框架从分发开始:OpenAI 不可能独自把 AGI 的收益带到“世界的每个角落”,因此 API 和第三方开发者至关重要。Apps SDK 延续了从插件到 GPTs 的迭代路径,如今连接到他回忆中约8亿 ChatGPT 周活用户;DevDay 同时披露开发者数量达到400万。

  • 主持人最精准的概括是一次倒置:过去是网站在角落里加一个聊天机器人,如今则是 ChatGPT 可以位于体验之上,把应用嵌入其中。Canva 展示了这种新形态——依然一眼可认是 Canva,但变成了对话式体验,并在 ChatGPT 的上下文中运行。Christina 称之为“我从未见过的体验”。

  • Christina 将插件视为一堂纠偏课:一条反馈是,企业几乎无法控制用户如何使用自己的集成,而且“受 ChatGPT 真正束缚”。因此,Apps SDK 为开发者提供定制 UI 和空间,让他们“真正拥有并掌控体验”,保留自身品牌,而不是变成隐形的后端功能。

2. MCP 是天然的共享协议候选,但连接器仍在广度与质量之间取舍

  • 随着 Agents SDK 和 Responses API 搭建出更具 agent 特征的工具调用栈,OpenAI 对 MCP 的承诺大约在3月成形。Sherwin 认为 Anthropic 真正把 MCP 做成了开放协议:变更过程足够开放,OpenAI 的 Nick Cooper 也在其指导委员会中;其通用且精简的设计让接入变得简单。主持人打趣道:“已经解决了。为什么还要自己造?”

  • 第一方“同步连接器”需要更多基础设施,因为 OpenAI 要存储大量状态;但这些状态也支持索引、向量搜索、重排和其他质量优化。MCP 覆盖了庞大的长尾需求,OpenAI 无需自行构建每一个集成,但开发者也就“只能听天由命”,取决于某个 server 的 API 形态是否适合模型使用。

  • Sherwin 表示,Connector Registry 应该能让企业更容易管理开发者可访问的内容、配置集成,并建立私有内部连接。主持人则指出,认证体系仍然碎片化——Gmail、Calendar 和 Drive 可能分别要求授权——但目标生态将同时包括 OpenAI 构建的连接器、优选第三方连接器,以及开放式 MCP server。

  • 对于工作流可移植性,Christina 直言:“遗憾的是,我今天没有一个很好的答案可以回答是或否。” MCP 和 OpenAI 的商业协议 ACP 已经展示了共享标准的价值;她和 Sherwin 希望 agent 工作流以及有状态的 Responses 式 API 都能实现可移植,让开发者不必仅仅为了切换模型而维护3套集成。

3. AgentKit 让生产级编排变得可视化

  • Christina 将 AgentKit 描述为一整套用于“构建、部署和优化 agents”的工具,起点是客户逐渐发现生产环境需要大量专业能力:提示词迭代、评测构建、建立信心以及部署。它的组件——Agent Builder、Agents SDK、Connector Registry、ChatKit 和 evals——既可以独立工作,组合起来又会作为端到端系统“彼此增强”。

  • DevDay 的8分钟构建演示刻意选择了一个简单的面向客户的助手,在下载问题出现前已经完成并留有时间;但真实客户的画布需要大幅缩小视图。将同样的流程转成 Agents SDK 文件后,代码会变得很长,因此可视化编排特别适合客服、文档发现与比较、信息 enrichment、规划、结构化数据问答和内部知识助手等场景。

  • 人工审批不只是 MCP 工具运行前的二元闸门。Christina 表示,企业工作流可能包含“持续数周”的真实决策,因此 human-in-the-loop 最终必须表达长期状态、复核和判断,而不是一个简单的批准或拒绝节点。

  • Agent Builder 有两个入口:一个是用于建模并将工作流导出到开发者自有系统的 playground;另一个是托管路径,利用自然语言、领域专家、数据集和 ChatKit,以更省事的默认配置完成部署。未来规划包括导入代码、在 builder 内运行代码、独立工作流运行、语音能力以及更丰富的逻辑节点。

4. Agent 评测从轨迹开始,而不是从单一分数开始

  • Christina 有意给出了一个克制的进展判断:agent evals 目前只完成了“所需进展的大约10%”。当前的突破在于接收 Agents SDK 的长轨迹并评估整体运行结果;多模态评测和更细粒度的诊断仍未完成。

  • 一个20分钟的 agent 任务打破了旧有的提示词—完成结果评测模型。OpenAI 希望评估完整轨迹,定位其中的单个片段,再分别优化每个片段,而且往往需要人工介入。主持人预计,LLM-as-judge 评测标准会成为核心机制,但产品仍处于“第一步”。

  • Evals 在发布当天就支持多模型:开发者可以接入 OpenRouter,使用 OpenAI 的 Datasets 工具编写 evals,并比较多个供应商的模型,包括通过 Together 提供服务的开源模型。这不是工作流协议,但承认了一个现实:agent 构建者越来越常常需要在同一套系统中评估多个模型。

5. Prompting 变成“零梯度”的模型定制

  • 围绕 GPT-5,自动提示词优化获得了重大推动,因为每个新模型都会带来新的行为特征,否则就需要再写一套详尽的提示词指南。Christina 希望建立这样的闭环:将 agent 的 evals 连接到持续的提示词和工作流改进,让平台能够为“你正在构建的东西”持续生成改进建议。

  • Sherwin 称提示词优化是产品和研究领域中异常活跃的方向,并提到 Databricks 团队的 GEPA 工作,同时强调相关技术仍会持续变化。但更重要的是判断发生了逆转:2年前,很多人预计 prompting 会消失;结果“如果说有什么变化,那就是它变得越来越根深蒂固”。

  • Sherwin 转述了对这种方法的概括——“零梯度微调”:通过足够的提示词适配,可以获得类似另一个模型的行为,而无需更新权重。他倾向于这条路线,是因为即便使用 LoRA,服务大量微调快照在运营上也很困难;提示词爬山可以带来收益,又不迫使开发者或供应商管理那套基础设施。

  • Tinker 代表一条互补的低层路径。Sherwin 表示,John Schulman 多年来一直在探索这种形态——一种面向研究的微调抽象,用户只需要“这4个函数”,无需处理底层基础设施;他欢迎 Tinker 发布,因为它能赋能构建者和研究者,尽管它来自 Thinking Machines。

6. ChatKit 降低部署摩擦,但经济账仍未解决

  • AgentKit 同时覆盖内部自动化和公共应用。企业反复构建内部系统,用于提示词和模板管理;而客服以及 Ramp 等产品又要求面向外部用户的质量。Christina 表示,help.com 的客服目前已经由 AgentKit 驱动,同时还有各种内部使用场景。

  • ChatKit 的 iframe 有意保持常驻且带有明确立场:当 OpenAI 增加一个推理行为不同或支持新模态的模型时,嵌入式应用可以直接继承,而无需重做前端。Christina 将其理念比作 Stripe Elements 和 Checkout——通用基础设施由中心团队持续维护,开发者专注于 agent 独有的部分。

  • 团队表示,ChatKit 本身是可嵌入的 iframe,并讨论了开源它的利弊;常驻且有明确立场的设计正是其价值所在。Christina 和 Sherwin 引导开发者使用 ChatKit Studio、Widget Studio、demo apps 和 ChatKit.world;主持人则追问 widgets 是否可能发展成更广泛的生态。团队强调了“消费级”打磨、响应式设计、流畅动画和 AI 生成 widgets。

  • 自带 key 无法开箱即用。Sherwin 承认,无法承担无限制公共推理成本的独立开发者长期以来一直有此需求;Christina 则警告,复制粘贴 key 的变通方案是“巨大的安全隐患”。降价只能部分缓解问题:“我们把它做得越便宜,需求增长得越快”,责任归属和支出控制仍未解决。

  • 更广泛的 ChatGPT 身份体系仍在探索中,并非已经宣布的身份提供商战略。Sherwin 表示,Apple 已经将部分身份带入 Siri,并根据用户是免费版、Plus 还是 Pro 订阅进行路由,包括 GPT-5 的访问权限;Kakao 则提供了另一种登录集成。被问及 ChatGPT 是否会成为 OpenID provider 时,他直接回答:“目前没有计划。”

7. Codex 加速构建,可靠性决定效率能否复利

  • Christina 从更年轻、更适应 AI 的开发者身上总结 Codex 的经验:要突破把模型当成“不可信实习生”的习惯。实习生会以“完全 YOLO 模式”把完整功能交给它;虽然 Codex 有时会失败,但约有“30%或40%的时候可以一次完成”,迫使她重新调整对有效任务规模的预期。

  • 主持人的反驳值得保留:vibe-coded pull request 可能只是把工作量转移给评审者。Christina 回应称,Codex 的 PR review 本身已经受到团队高度重视,但她并未声称 Codex 能完全自主完成工作:输出仍需“检查和编辑”,模型只是一个强力起点,而不是自行批准自己的代码。

  • 最直接的生产力证据来自可视化 Agent Builder:它在 DevDay 前不到2个月才启动,按 Christina 的判断,如果没有 Codex,不可能在这样的时间线上完成。团队成员还会在30分钟的通勤途中启动大约5个 Codex 任务,即使最后丢弃生成的 PR、自己重写实现,也能借助结果梳理文件并找回上下文。

  • Christina 最后发布的是组织级服务健康仪表盘,追踪响应、token 速度、TPM、吞吐量和状态码,作为一项“实时个人 SLO”。在一次持续约3–4小时的12月故障后,OpenAI 讨论了从三个9、三个半9、四个9逐步迈向五个9;每增加一个9都需要“指数级更多的工作”。此前提到的每分钟60亿 tokens 已经被超越。