先锋 趋势 方法 投研 作者
AI中的超大规模测试时算力正在改变基准、安全与研究:与OpenAI的Noam Brown对谈
返回节目精读

AI中的超大规模测试时算力正在改变基准、安全与研究:与OpenAI的Noam Brown对谈

摘要

  • 没有测试时算力预算的基准分数,已经无法清晰衡量模型质量。 Brown称,标准网格上5.5相比5.4只略有提升,但用户很快发现实际体验的改善幅度要大得多。他将网格结果低估表现归因于没有测量测试时算力,并称5.5的思考效率更高;此外,在控制思考时间后,o3相对o1的跃升也相当可观。替代方案应是成本、token或时间曲线:「应该有一条横轴」(There should be an x-axis)。在实际使用中,他建议需要时快速迭代,问题值得深入处理时则允许模型进行更长时间的思考。
  • 行业可能在任何人发现模型能力上限之前,就已经发布了下一代模型。 现代系统在合理搭建脚手架后,可以连续数周获得改进,在1亿个token之后仍处于上升斜率;而新模型每2-3个月就会发布。Brown建议用小规模运行外推昂贵任务的表现,例如用预算上限为10美元或100美元的实验,预测10,000美元推理预算下的结果。
  • 安全框架继承了同样的测量失灵,而且 stakes 高得多。 围绕GPT-3设计的政策大体把能力视为模型的内在属性,但如今能力「取决于你投入多少钱」:预算为10,000美元时,模型可能远胜于10美元预算,投入1,000万美元又可能解锁更高能力。现有政策没有清楚回答,评估网络攻击、生物武器或其他危险能力时,究竟应以哪档预算为准。
  • Brown的扑克求解器测试表明,模型进步幅度远大于基准分数变化所显示的幅度。 用5.2时,他构建河牌求解器的速度约为独自完成时的5倍,尽管模型仍可能不可靠;5.5在温和引导下已经几乎可以构建完整求解器。若6个月或1年内出现一个模型能够复现「基本上我的整篇博士论文」(basically my entire PhD thesis),他不会感到意外。
  • 现有模型可能已经具备有价值的科学能力,只是短期挖掘仍不经济。 Brown称,经过脚手架搭建的5.5,很可能能在OpenAI内部模型之前找到Erdős单位距离猜想的反证,推理成本大致为1,000–100,000美元。如果每次发布都能将这类发现的成本降低10倍或100倍,某些情况下甚至更多,投资问题就变成:何时部署算力,何时等待下一条成本曲线。
  • 递归式自我改进看起来是渐进过程,因为研究品味和时间仍是硬约束。 模型可以将现有算法优化10–100倍,却仍然无法发明更好的算法;而最强结果需要长时间运行推理:「时间本身变成了瓶颈」(Time itself becomes a bottleneck)。更大的上行空间可能来自持久化的多智能体知识积累,而不是一夜之间出现的智能爆炸。
  • 路由业务必须证明,在同等成本下,它们胜过直接让最强模型进行更长时间的思考。 多模型共识可以提高分数,但Brown追问,在统一测试时算力后是否仍然占优,以及基准上的提升能否经受真实世界使用的检验。这使预算标准化评估成为判断路由、编排和模型选择层价值的核心。

精读

上游暂未提供,后续同步将继续补齐。