先锋 趋势 方法 投研 作者
No Priors 第112期|Isa Fulford 谈 OpenAI Deep Research
返回节目精读

No Priors 第112期|Isa Fulford 谈 OpenAI Deep Research

摘要

  • Deep Research 最初的有意押注,是把只读式综合而非交易型演示作为高杠杆的首个智能体方向。 OpenAI 于2月发布了它,并正向所有美国用户免费开放。当其他智能体构想聚焦于订购汉堡或鲜花时,Isa Fulford 的团队瞄准了文献综述、产品发现,以及横跨多个来源的其他知识工作。其战略前提很直接:「如果你连文献综述都写不了,就不可能写出新的科学论文」(“If you can’t write a literature review, you’re not going to be able to write a new scientific paper”);而只读式操作也让最初的安全问题更受约束。

  • 它的路径不只是浏览,而是围绕开放式、有用工作构建的强化学习。 由于浏览缺乏类似数学题那样的 ground-truth 数据集,团队先明确产品希望达成的结果,招募多个领域的专家,生成合成数据并建立 graders;随后将能够打开 PDF 和嵌入图片的文本浏览器,与用于计算和绘图的 Python 配对。模型有时会在没有明确指令的情况下学会规划或使用出人意料的搜索方式,但也可能尝试绕过限制,既体现了泛化能力,也暴露出控制风险。

  • Fulford 判断是否做 RFT,看的是真实的经济价值:只有当工作流确实属于分布外任务,或再提升10–15%就会决定成败时,训练才值得。 基因测序这类专业任务,在反复提示仍然失败后,可能值得做强化微调;对业务至关重要、边际准确率会实质改变结果的工作流也一样。但如果每个新基础模型都已经在持续降低错误率,「这可能就不值得投入这番功夫」。

  • 答案越全面,越容易获得信任,也因此形成信任悖论,使引用质量成为验证关键。 Fulford 称,Deep Research 的幻觉比 OpenAI 此前发布的任何模型都少,但它仍可能从来源中错误推断某件事;用户也可能正因为它花了更长时间、返回了更多细节而更加信任它。引用让用户能够核查这条推理链;未来能够采取行动的智能体会进一步抬高风险,因为「发出一封令人尴尬的邮件」并不算完成任务。

  • 产品路线图指向一个同时覆盖私有检索、编程、研究和外部行动的单一智能体。 Fulford 理想中的系统是「凡是你会委托给同事的事情,它都应该能做」,包括搜索内部文档或 GitHub、调用 API、准备 PR,以及协助预订旅行。人的工作会沿着更高的抽象层级上移:从请求一个函数,到一个文件,再到一个 PR;与此同时,用户仍可以审查、打断或接管。

  • Deep Research 最适合精确、约束密集的问题,尤其是需要实时信息和全面检索的场景。 Guo 举例说,可以用它寻找本季特定的一件外套、难找的 RealReal 商品,或满足大量条件的 Airbnb;对于高层次探索,普通搜索或通用模型更合适。它目前「每次都用最长思考时间」可能过度消耗资源,Fulford 认为最终应由模型而非面向用户的 effort 开关来决定一项任务值得花多长时间。

  • 长时运行智能体的机会很大,但记忆、上下文管理和安全是关键约束。 Deep Research 目前大约用5–30分钟完成专家认为需要数小时的工作;Fulford 想象它用1小时处理人类数天的工作、用1天处理数周的工作,甚至可能承担类似论文的项目,同时明确承认这会带来规模化挑战。持久记忆将非常重要,这样研究才能不断积累,而不是每次从头开始,尤其是在智能体开始持有私有数据、代码仓库和密码之后。

精读

1. 只读式综合是有意选择的首个切入口

  • Fulford 将项目的起点追溯到大约一年前强化学习在数学、科学和编程上的进展。她和 Yash 当时分别在探索智能体,并思考同一套算法能否处理日常浏览和软件工程工作;Fulford 专注于浏览。OpenAI 于2月发布了 Deep Research,并正向所有美国用户免费开放。

  • Sarah Guo 的反驳值得保留:大多数浏览智能体的构想,最后都会收敛到订购 DoorDash 或鲜花这类交易型演示。Fulford 的回答是,应该从更具野心、适用范围更广的问题开始——把多个来源综合成一份有用的报告,因为「大量知识工作职业,本质上主要就是在做这件事」。

  • 数学和编程已有现成的 ground-truth 数据集,浏览则是开放式的。因此,团队围绕希望产品达成的结果来组织研究,例如根据 Reddit 评论给产品排名,或撰写文献综述。

  • 科学上的理由构成了这项工作的北极星:新的发现要求掌握已有研究,因此具备撰写文献综述的能力,是产出新研究的前提。只读任务同时也是一种务实的安全选择,相比赋予智能体交易能力,这是一个约束更多的起点。

2. 产品始于演示,随后逼出了全新的训练栈

  • 最初的内部产物完全由提示词驱动的模型和一个用于传达产品愿景的界面组成,「没有涉及任何模型训练」。要把这个演示转化为 Deep Research,团队需要新的数据、graders、浏览工具,并与 OpenAI 的 RL 团队反复协作;几个月没有立即上线的压力,让团队可以专注于「让 eval 指标持续上升」。

  • 一项持续性的评测要求找出 Liam Fedus 和 Barrett Zoph 合著的全部论文;Fulford 原以为有11篇,而模型现在已经能找到其中大多数甚至全部。另一项任务是查一位同事的中间名,模型如今无法回答,「可能是出于充分的理由」。内部需求很早就出现:Sam 曾用一个更弱的版本买东西,而每次系统宕机,同事都会发消息问:「发生什么了?我们需要用这个模型。」

  • 部分数据由人工训练员提供,团队同时寻求覆盖多个职业,并构建合成数据集。按 Fulford 的说法,RL 的优势在于,专家不必规定完整的研究流程:他们只需定义任务和期望结果,「模型会在训练过程中自行学会如何从问题走到一个好的答案」。

  • 如今的工具包括可以检查嵌入图片和 PDF 的文本浏览器,以及用于分析、计算和绘图的 Python。每次未来扩展工具,都会带来新的数据问题:训练必须覆盖工具选择、回溯和灵活恢复,而不只是把一个 API 暴露给模型。

  • 模型并没有被预先教会规划,但它有时会在开始研究前自行规划;它也会使用 Fulford 不会选择的搜索词,并可能尝试绕过限制。因此,团队必须留意黑客行为,或尝试使用未经批准的搜索引擎。

3. 强化微调只有在性能边际上才值得其成本

  • Fulford 给初创公司的实际判断标准是:如果大量提示仍然失败,原因是任务与可能见过的训练数据不同,那么就值得考虑。她以专业的基因测序任务为例,认为这类任务足够分布外,值得做强化微调。

  • 第二种情况与技术无关,而是财务问题:如果核心工作流「额外10–15%的性能真的决定成败」,就应该为此训练。当一个已经足够强的模型会随每次发布自然变好时,定制 RFT 可能刚好在基础模型追上来之前消耗大量精力。

  • 她还指出,训练能力可以泛化:一个主要用数学、编程及相关问题训练的推理模型,可能会变得擅长写作,尽管如果专门用写作训练,它在这项任务上的表现会更好。

4. 更强的智能体让能力与安全成为同一个问题

  • Deep Research 篇幅很长、内容全面的报告,可能让用户产生更强的信任。尽管 Fulford 称它的幻觉比 OpenAI 此前发布的任何模型都少,但它仍会从来源中得出错误推断;因此,引用是必要的审计轨迹,而不是装饰性的来源标注。

  • Deep Research 目前无法执行典型智能体安全问题所涉及的行动,但统一智能体必须同时具备研究和执行能力。Fulford 的标准是结果导向的:如果智能体完成了名义上的任务,却发出一封令人尴尬的邮件,那么意外副作用意味着它并没有成功完成任务。

  • Guo 问,安全究竟应依赖明确的护栏,还是依赖学习出来的行为。Fulford 倾向于最初采用确认机制,类似 Operator 对每一次写入操作都要求确认;随着反复成功建立信任,再逐步授予权限。即使这些机制不是最终能力形态,她仍预计智能体上线时需要护栏、确认和有意义的监督。

5. 精确约束揭示了 Deep Research 击败普通搜索的地方

  • 专家已经在 Fulford 无法亲自判断的领域验证了输出,包括医学研究。出人意料的使用场景包括代码搜索、寻找仓库中最新的包或最新版本以协助编写文件,以及把上传的文件与数值分析结合起来;她认为,这种广度部分来自 o3 所继承的强大编程、数学和推理能力,再叠加浏览能力。

  • 她的分流原则是问题是否具体。需要当前在线证据和全面答案的明确问题,适合 Deep Research;一般性的主题了解,则交给普通搜索或常规模型。即便某些事实可能已经存在于模型权重中,实时检索仍然有价值。

  • Guo 把时尚例子说得很具体:给定偏好的品牌、特定的仿皮草大衣长度,以及本季是否有货,Deep Research 可以满足完整的约束集合。她同样会用它寻找难以找到的 RealReal 商品,或满足精确要求的 Airbnb——这些查询「我可能要花几小时才能找到」;她还说,o1 的浏览没有这么全面。

  • Guo 希望有一个5分钟的 effort 开关,但 Fulford 认为「让用户自己决定似乎是糟糕的 UX」。Deep Research 是有意按「每次都用最长思考时间」训练的,而 o3 或 o-next 可能提供更合适的中间选项;Fulford 说,后续版本应该能填补这段空档。

6. 终局形态像一个持续在线的远程同事

  • 随着任务从目前的5–30分钟扩展到数小时或数天,记忆会变得非常重要。每次任务都重复输入偏好和背景已经令人厌烦;未来的研究应该能够不断积累、保留状态,并高效管理有限的上下文,而不是「每次都从头开始」。

  • Fulford 认为,基础模型预训练和 RL 会相互叠加:RL 使用规模更小但质量更高的数据,但整理任务、结果和等同于人类使用的工具,仍然是大量工作。各团队会向大型 RL 运行贡献数据集,而由此获得的算力又会改善基础模型,Fulford 的团队再以这些模型为基础继续训练。关键阻碍包括安全访问代码仓库、密码和私有数据,管理长时间运行的上下文,以及持续投入精力构建工具和可评测数据集。

  • Guo 形容第一次训练成功时的直觉冲击是:「这条路上铺满了草莓。」但能力仍然参差不齐:模型可以执行出令人惊讶的聪明步骤,随后又犯下一个让人忍不住问「你为什么要这么做?停下」的错误。

  • Fulford 希望在1年内拥有一个既能准备 coding PR、又能协助预订韩国旅行的智能体。界面会把委托与干预结合起来:它像 Slack 上的远程同事,同时允许用户在 VS Code 或 Cursor 中打断;这样也能减轻用户判断每项任务该交给哪个专用智能体的负担。