新版 OpenAI Agents Platform:CUA、Web Search、Responses API、Agents SDK!!
摘要
OpenAI 正将 Responses API 定位为新型智能体应用的默认入口,同时承诺 Chat Completions 仍将维持多年。 swyx 将这一方向概括为一个“严格超集”,把 Chat Completions 的能力与 Assistants 的工具和状态结合起来。Assistants API 计划于 2026年上半年退出;OpenAI 将为 Responses 增加 assistant 类对象、thread 类对象、Code Interpreter、异步模式和 webhooks,并给用户整整1年迁移时间。
这套平台正围绕统一的智能体技术栈,打包 Web Search、托管式检索、计算机控制、编排和可观测性。 开发者可以在“1次 API 请求”中组合多项能力;Romain 表示,需要完全掌控检索流程的团队仍可自建基础设施。
Web Search 展示了工具对模型表现的提升幅度:SimpleQA 准确率从 GPT-4o 的 38% 升至 GPT-4o Search Preview 的 90%。 Responses 将搜索开放为可组合工具;Chat Completions 则要求使用专门的搜索模型,因此 o1 不能直接在其中调用搜索。结合函数调用和结构化输出,Nikunj 称其“几乎就是互联网的 API”。
Responses 免费保存状态30天,在不强制应用状态化的前提下改善调试体验。 开发者可以设置
store: false;保存的 response 会在控制台展示提示词、工具调用和配置失败信息。不过,swyx 仍援引 Corey Quinn 的警告:“凡是能拿来当数据库的东西,最终都会被拿来当数据库用”(Anything that can be used as a database will be used as a database)。File Search 被定位为面向不想自行掌控每个检索决策团队的托管式 RAG。 它负责解析、切分、生成 embeddings、向量存储和搜索;讨论还涉及查询优化与自定义重排序。元数据过滤被认为是最重要的后续功能之一,尤其是在记录数超过约 5,000–10,000 条之后。要获得完全控制,仍需自建整套技术栈。
Computer Use 仍是早期的专用能力,还不是成熟的通用基础组件。 它的模型读取截图,并针对可能需要20步、持续数分钟的任务返回点击、滚动、输入等工具调用。Romain 将其称为“计算机操作领域的 GPT-2,甚至可能是 GPT-1”(the GPT-2 of computer use or maybe GPT-1)。
Agents SDK 将意外走红的 Swarm 实验升级为 OpenAI 的编排层。 类型系统、可并行运行的 guardrails、handoff、追踪和供应商可移植性,支持构建专业化智能体,而不是“一个智能体统治一切”(one agent to rule them all)。长期来看,OpenAI 希望让 traces 生成 evals,再由 evals 驱动强化微调,但“还有大量细节”尚未解决。
精读
1. Responses 成为 OpenAI 统一的智能体基础组件
此次发布将3个内置工具——Web Search、升级版 File Search 和 Computer Use——与全新的 Responses API,以及源自 Swarm、经过升级的 Agents SDK 打包在一起。
swyx 用“严格超集”描述其目标方向:Responses 在发布时支持 Chat Completions 的全部能力,计划逐步吸收 Assistants 的能力,同时通过
store: false保持无状态。Chat Completions 最初于 2023年3月左右推出,面向单轮文本工作流;它“会长期存在”,并继续支持新模型和新功能。Assistants 则计划于 2026年上半年退出;OpenAI 将把 assistant 类对象、thread 类对象、Code Interpreter、异步模式和 webhooks 加入 Responses,并给用户整整1年迁移时间。
状态可免费保存30天。Alessio 强调了控制台级别的调试能力——查看提示词、工具选择和配置——swyx 则引用 Corey Quinn 关于“任何能被当作数据库使用的东西”的警告;Romain 指出,用户早已在对象元数据里塞入各种数据。
2. Web Search 将实时信息转化为结构化应用数据
搜索以两种方式提供:作为 Responses 的内置工具,或作为 Chat Completions 中的 GPT-4o Search Preview。后者不能作为工具挂载到 o1 等其他模型上。
搜索微调重点提升正确材料的检索能力、事实准确性和引用准确性;Nikunj 提到了合成数据技术和模型蒸馏。在 SimpleQA 上,主持人强调其准确率达到 90%,而 GPT-4o 为 38%。
Nikunj 给出的最佳可组合案例,是将 Web Search、函数调用和结构化输出结合起来:实时网页信息可以直接进入应用所要求的 JSON schema,“几乎就像互联网的 API”。
主持人追问了检索深度和成本问题:top-K 可能返回无关的填充内容,而相似度阈值可能返回5份或500份文档,使支出在每1,000次查询约30美元的水平上变得难以预测。Nikunj 表示,深度目前还不是一个可调参数,并建议通过编排加入规划步骤、逐步增加调用深度;swyx 则提出用上下文预算管理成本。
3. File Search 提供托管式 RAG,代价是控制权
File Search 接收私有数据,并负责解析、切分、生成 embeddings、搜索和向量存储。讨论还涉及查询优化与自定义重排序;元数据过滤被认为是最主要的待加功能,尤其当存储规模超过约 5,000–10,000 条记录后。
Nikunj 给出的最佳组合工具案例,是把用户的阅读或时尚偏好存入 File Search,将其作为记忆检索出来,再在网上搜索匹配的商品——所有步骤都在1次 Responses 调用中完成:配置好工具后,“轰的一下,所有事情就都发生了”。
swyx 提到 Navan 将常见问题和旅行政策加载到 File Search,让智能体无需重建检索基础设施就能使用这些政策。OpenAI 的建议很务实:先采用托管方案,只有在完全控制确实重要时,再自行实现切分和检索。
4. Computer Use 将智能体延伸至长链路界面操作
Computer Use 背后的模型接收截图,通常返回工具调用——点击、滚动、输入,然后回传结果。一个浏览器任务可能需要“几分钟”,以及大约20步,这也解释了为什么 Responses 从设计上就面向多轮、长链路执行。
Romain 称这项能力为“计算机操作领域的 GPT-2,甚至可能是 GPT-1”。主持人提出将 Pokémon 作为智能体基准测试;OpenAI 认为值得尝试。Romain 表示,愿景是等 preview 微调模型稳定后,将其并入核心模型,正如视觉能力此前完成的整合。
5. Agents SDK 让 handoff 可观测、可训练
Swarm 最初只是一个“低调的实验”,用于多智能体编排;但意外的采用规模促使 OpenAI 将 handoff 提升为核心平台组件,并以 Agents SDK 命名。
SDK 增加了类型系统、可并行运行且能阻断执行的 guardrails,以及内置 tracing。Responses 是默认选项,但任何实现 Chat Completions 格式的供应商都可以接入,多个 tracing 供应商也同样支持。
Romain 将一个受监控的分诊智能体交接任务给专业智能体的模式,与塞满工具调用、试图“一个智能体统治一切”的模式作对比。控制台中的 traces 会展示每次 handoff、下游智能体和工具调用,便于排查问题。
Romain 的路线图是先用 traces 生成 evals,再用高质量的评测器和任务进行强化微调。“还有大量细节”待解决,但 OpenAI 打算大力推进这条从 trace 到 eval 再到 RFT 的闭环。