先锋 趋势 方法 投研 作者
《后训练现状》:从 GPT-4.1 到 5.1:RLVR、Agent 与 Token 效率——Josh McGrath,OpenAI
返回节目精读

《后训练现状》:从 GPT-4.1 到 5.1:RLVR、Agent 与 Token 效率——Josh McGrath,OpenAI

摘要

  • 后训练的经济吸引力在于杠杆:Josh McGrath 将追求 3% 的预训练算力效率提升,与改变模型 40% 的行为进行对比。 代价是运营复杂度:每个 RL 任务都可能带来独立的评测器和基础设施,放大一次运行失败的路径。真正稀缺的能力,是同时熟悉 ML 与分布式系统,而不是只精通其中一门。

  • 从 RLHF 转向 RLVR,关键是奖励数据更干净,而不只是换了一个优化器。 McGrath 认为两者本质上都是策略梯度方法,只是处在信号质量不同的光谱上:人类偏好有用,但不如数学解答是否正确那么可信。他批评已发表研究把重点放在梯度方差、GRPO 等方法上,而真正的创新在于“数据从哪里来”。

  • 从 GPT-5 到 5.1,战略上最重要的进步,是用少得多的 token 获得更好的评测结果。 McGrath 用 token 而不是小时衡量 Agent 的任务跨度,因为一个人需要 4小时完成的任务,Codex 可能 10分钟就能完成;token 消耗下降,就能在实际服务预算内留下更多工具调用和行动空间。主持人谈到质量与 token 曲线时说:“老哥,我就靠那些图活着。”

  • OpenAI 的购物模型是测试可中断、可操控 Agent 的试验场,这些能力未来可能汇入通用模型。 用户可以看到模型正在考虑哪些商品,并在运行过程中修正需求——“我想要的是 USB-C。”McGrath 已经更偏好高强度思考的 GPT-5 Thinking,而不是最初的 Deep Research 模型,因为公开评测“基本持平,甚至更好”,尽管有些用户确实更喜欢不同模型各自的脾气。

  • 长上下文与压缩是互补押注,而上下文利用不充分更像暂时问题,而非根本缺陷。 McGrath 预计,扩大上下文窗口与发展长期保留有效信息的方法之间会持续“共舞”;Graphwalks 评测之所以重要,是因为它要求在整个上下文中进行多次变换,而不是从单一位置检索信息。尚未解决的问题是,超大窗口最终会成为直接存储,还是承载大量子搜索的基础设施。

  • 预训练和后训练都没有过时,而当前的算力分配也无法让人确定最终均衡会是什么样。 McGrath 提到,早期工厂用一台电机带动整间厂房的设备:电力这项变革性技术直到数十年后布局改变,才真正显出威力。预期进展会时而沉寂、时而陡峭——“一切都完了。我们又杀回来了”——因此,路线图的灵活性和情绪稳定,比自信宣布未来已经定型更有价值。

精读

1. 后训练以运营复杂度换取行为杠杆

  • McGrath 从预训练数据整理转向后训练,是因为两者的杠杆完全不在一个量级:“我是要追求大约 3% 的算力效率提升,还是要把行为改变 40%?”他并不认为预训练已经过时;只是后训练提供了更令人兴奋的前沿,这一点被“无数个深夜”进一步确认。

  • RL 运行涉及更多活动部件,因为每个任务都可能需要独立的评测配置和配套基础设施。凌晨 12:30,排查一次可疑运行意味着要迅速读懂多个组件、多个贡献者写的代码;代码来自内部还是外部合作方并不重要,关键在于研究者是否理解底层系统。

  • 主持人说,Codex 改变了他的生产函数:写一份设计文档之类的东西,原本要花 30–40分钟,现在 15分钟就能触发比手工数小时完成的工作更多的后续产出。尚未解决的是人的时间安排——这类 15分钟的 Agent 工作间隔太短,接不上另一项深度任务,让他“还在适应”这种新的工作节奏。

2. 专用 Agent 正在验证最终会汇入通用系统的交互模式

  • 购物模型源于 8月一次围绕 Black Friday 上线的建议——当“现在它归你了”变成现实后,McGrath 开玩笑说自己有些后悔。它最重要的特性是可中断:用户能看到模型正在考察哪些商品,也能在运行中修改提示词,比如补充一句:“我想要的是 USB-C。”

  • McGrath 认为,购物从根本上并不需要一个独立模型。推出专用版本,只是更方便测试“适用于购物的 Deep Research 风格模型”,让它在整个互联网范围内广泛搜索;他的判断是,专用系统与通用系统最终会“在能力上汇合”。

  • 最初的 Deep Research 模型与高强度思考的 GPT-5 Thinking 之间,已经能看到这种汇合。McGrath 表示,OpenAI 的公开评测结果看起来“基本持平,甚至更好”,他自己使用 Thinking on High,同时也承认用户完全可能理性地偏好旧模型的独特风格。

  • 个性仍然是产品的真实维度,但 McGrath 自己的偏好更偏工具属性:“我个人希望我的模型是一个工具。”主持人把选择概括为 Anton 与 Clippy 之争——安静而可靠的能力,还是热情而主动的协助;McGrath 表示,OpenAI 正通过开关和自定义指令同时提供两者。

3. RLVR 的突破在于可信反馈,而不是优化器的品牌效应

  • McGrath 的框架消解了一个流行区分:RLHF 与 RLVR 都是策略梯度方法,主要差别在输入数据。把 RLHF 称为“不可验证”略显奇怪,因为训练后的模型确实是在预测人类反馈;更深层的区别在于目标是偏好还是真实性,以及这种信号能够承受多大程度的优化。

  • 他批评当前研究讨论常常把论文写成优化工作——聚焦梯度方差——而真正重要的轴是信号的干净程度。实际问题是:“我有多信任它?”以及在持续优化下会发生什么;人类偏好评分的可靠性,显然不如验证一道数学题的解答。

  • 主持人提到 DeepSeek Math 论文中的 GRPO,认为这种优化方法的影响力似乎超过了最初的预期。McGrath 则把注意力重新引向奖励信号:“当你找到一道数学题的答案时,争议空间就小得多。”方法当然重要,但这种高度可信的新奖励信号,才是被行业低估的变化。

4. Agent 任务跨度的提升,来自模型少用 token,而不只是运行更久

  • McGrath 不接受用 30小时或1天来定义长跨度自治;他用 token 思考问题。Codex 可能把人类 4小时的工作压缩到 10分钟完成,因此经过时间掩盖了真正可优化的变量。从 GPT-5 到 5.1,综合评测得分提升,而质量与 token 的曲线显示 token 消耗大幅下降。

  • Token 效率会直接改变 Agent 的可行边界:它决定在真正可服务的合理 token 数量内,能够容纳多少次工具调用和行动。主持人说:“老哥,我就靠那些图活着。”因为这些曲线同时记录了基准能力,以及等待任务完成时的真实使用体验。

  • 主持人的质疑是,显式调用 GPT-5 的路由与隐式控制思考力度可能发生冲突:上游路由器可能做出错误选择,即使 GPT-5 本身有能力判断任务难度。McGrath 预计,今天不断增加的旋钮最终会简化成“一个你总会使用的工具”,由它决定该思考多久。

  • 对于上下文压缩,McGrath 没有透露产品细节,但预测会长期采取双向策略:一边增加上下文长度,一边开发让窗口更长时间保持有效的方法。他提醒不要把接口冻结,因为固定的抽象层可能“困住”某次未来的模型改进,而那次改进可能要求接口本身发生变化。

5. 模型与系统必须共同演进,因为两条扩展路径都尚未定型

  • McGrath 并不认为完美利用上下文是无法实现的目标。他以自己参与 GPT-4.1 评测的 Graphwalks 为例,称他们把上下文窗口效应放大到了 10×;这类评测要求在整个窗口中进行多次变换,因此分数仍在持续上升,不同于只检索某个孤立事实的测试。他认为上下文利用不充分“肯定是一个暂时问题,我们会随着时间推移不断爬坡”。

  • 主持人描述了一个针对公司客服工单的 RAG 代码库:10万份文档,总计约80亿 tokens。这种规模需要检索系统,而不是单纯依赖一个 1000万 token 的窗口。McGrath 的回应刻意保留了不确定性:搭载 GPT 的 Agent “就是异常有效”,但巨大的上下文也可能服务于一个更大的计划,其中包含大量子搜索。模型扩展与系统工程仍然需要共同设计,而不是二选一。

  • 最难招聘的人才画像,正是能同时驾驭分布式系统、核心工程、统计学和 ML 的研究者。项目瓶颈可能反复在基础设施与学习之间移动,但教育体系通常不会同时针对两者进行优化。McGrath 低置信度的理论猜测是,这两个领域大致同样困难;一些传统意义上的 ML 研究可以更多地当作黑箱处理,而构建训练环境则是复杂的数据工程问题。

  • 主持人还引用了一张 Grok 4 图表:当预训练扩展到某个算力水平后,如今投入后训练的算力已经达到可比规模。McGrath 拒绝宣称预训练或后训练已经胜出。就像早期工厂用电力带动整间厂房的一台电机一样,行业可能正用旧技术时代继承下来的布局承载新能力,尚未找到它们的自然形态。某些想法可能沉寂一阵后突然回归,因此这个周期会反复让人觉得“一切都完了。我们又杀回来了”。