🔬GPT‑5 如何推导理论物理与量子引力新结果——Alex Lupsasca,OpenAI
摘要
Alex Lupsasca 认为,前沿物理已经从AI辅助跨入了在边界明确的研究任务上达到超人水平的阶段。 ChatGPT o3 将一项原本需要数天的计算压缩至11分钟;GPT-5 在30分钟内复现了他最重要的论文之一;近期模型还解决了专家追踪一年的问题。他对这一里程碑的判断是绝对的,但对其适用范围保持条件限定:“至少在某些方向上,AI已经达到超人水平”(“at least in some directions AI has become superhuman”)。
这项旗舰成果把随粒子数阶乘式爆炸的胶子计算,替换成了规模只随粒子数线性增长的公式。 人类发现,在特殊时空设定下,当粒子变得共线时,单负螺旋度胶子树振幅并不一定为零;GPT-5.2 Pro 简化了5点和6点情形,猜出了通式;一个更强的内部模型又在12小时内独立重新发现并证明了它。“他甚至还没下飞机,我们就已经解决了这个问题”(“We solved the problem before he even got off the plane.”)。
第2篇论文表明,第1项成果并非偶然:公开版 ChatGPT-5.2 Pro 将这一方法从胶子推广到了数学上不同的引力子振幅。 模型选中了有向矩阵树定理,完成了多轮检查,并通过一场110页的对话产出了论文的大部分内容。团队称,模型大约在第1篇论文发布后3天就能给出第2篇;最终耗时3周,是因为人类进行了细致核验。“大部分时间花在验证答案,而不是写作上”(“Most of the time was spent verifying the answer, not writing.”)。
研究经济学正在从生产计算转向选择问题、验证大量产出。 Lupsasca 说,只要引导得当,对于难度不高或类似已知计算的问题,模型可能每天产出1篇论文;10个并行对话则能侦察不同路径,快速淘汰死路。稀缺的人类贡献将变成品味、专家引导和验证,而不是原始符号劳动。
AI目前更像一名能力惊人的研究生,而不是能自主设定科学议程的人。 给它一个尖锐、定义清楚的问题,它就能完成前沿计算;但“优秀物理学家与伟大物理学家的区别,在于知道该问什么问题”。这道护城河正在收窄:当被要求为胶子论文提出3个后续方向时,GPT给出的基本就是Lupsasca自己的3个首选。
赋予研究者“AI超能力”的同一项能力,也在威胁训练体系和信息质量。 传统上需要6至12个月的研究问题如今可以被“碾碎”,学生借此建立技术与信心的成长仪式正在弱化;与此同时,措辞糟糕的提示词也能生成包装精美的“AI垃圾内容”,充斥 arXiv。Lupsasca 的应对是提高发表门槛,而不是花一年写出30篇增量论文。
验证、形式化和科学传播正在成为新的基础设施机会。 自然语言推理已经强到让形式化证明显得没那么紧迫,但大规模并行生成又把负担推回给人类,使 Lean 等工具重新变得更有价值。Lupsasca 也怀疑静态论文还能否再撑20年:他设想的将是交互式研究对象,能解释全局、展示推导,并按需展开细节。
精读
1. 前沿物理从邮件工具跃迁至研究级推理
仅仅1年多前,Lupsasca 还认为AI最多适合处理邮件,与那些构成其研究核心的“重要理论物理计算”无关。ChatGPT o3 只用11分钟就完成了一项他原本需要数天的计算;据他所知,普通科学软件也无法完成这项任务。
GPT-5 带来了更彻底的转变。只给出一个热身提示,它就在30分钟内复现了Lupsasca最重要、最困难的论文之一——他认为只有少数几个人能够完成的计算。“天啊,这改变了一切。”他回忆自己当时这样想;在休假期间加入 OpenAI,成了顺理成章的选择。
Lupsasca 说,GPT-5.4 又实现了一次大幅跃升,即便消费者只看邮件质量,几乎也察觉不到变化。他对 GPT-5 最初反响冷淡的抱怨很直接:“GPT-3就能写邮件。它写邮件还能好多少?重点不在这里。”前沿科学能力的进步速度,远远超过了消费者看得见的体验。
研究团队如今会主动传来证据。一位通信对象称,Codex 在10分钟内生成了技术要求很高的 SYK 模型模拟,此前物理学家为搭建它苦苦挣扎。RJ 指出,许多物理学家也具备编程能力;Brandon 则强调,有能力的研究者本来就会尝试这件事,最后得出的结论是:“Codex 现在真的很强了。”
2. 散射振幅压缩了量子场论中的信息
Lupsasca 从量子场论必须调和的一组张力讲起:相对论绝对禁止信息超光速传播,而量子力学则认为物理量本质上带有模糊性。量子场论是20世纪用来同时容纳这两项原则、并通过概率结果描述力的理论框架。
这些概率来自对称为量子振幅的复数量求平方。散射振幅规定了具有给定能量、动量和偏振的粒子相撞后,以另一种构型出现时可能发生什么;如果知道任意 n 的 n点振幅,就“大致上”等于知道整个理论。
偏振引入了螺旋度:光子的横向箭头在传播时可以右旋或左旋,形成正或负螺旋度。传递束缚原子核的强力的胶子,也带有类似标签。树振幅提供领先阶贡献,圈图则增加相互作用,因此带来耦合常数更高次幂的、逐渐变小的修正。
3. 共线漏洞重新打开了教材认定为零的振幅
如果所有胶子都具有正螺旋度,树振幅就会为零:这种相互作用被禁止,无法发生。教材将基本相同的论证延伸到单负构型,即其中1个胶子具有相反螺旋度,并同样将该振幅视为零。
下一个情形是2个负螺旋度胶子,它 famously 不会消失。Parke 和 Taylor 在1980年代的计算汇总了大量几乎完全相互抵消的项,最终只剩下一条简洁公式。这些振幅后来被称为“最大螺旋度破缺”(MHV)振幅;但Lupsasca如今更偏好理论色彩较弱的“双色负”描述。
Alfredo Guevara、David Skinner 和 Andrew Strominger 发现了一个漏洞:零值论证假定粒子从一般方向抵达。当部分粒子严格共线,并在所需的特殊时空签名下考察问题——通俗地说,就是“2个空间维度和2个时间维度”——单负振幅就可能非零。
人类可以表示出答案,却无法揭示它的简洁形式。3个粒子给出1项,4个给出2项,5个给出8项,6个则产生32项复杂表达式;对一般 n 而言,费曼图数量按阶乘增长。整整1年,他们都在寻找 Parke–Taylor 式奇迹简化的单负对应物。
4. GPT将阶乘展开压缩成线性公式
在 Strominger 按计划到 OpenAI 合作之前,团队把5点、8项的表达式输入公开版 ChatGPT Pro。模型找到了一个相空间区域:其中1个粒子的频率符号与其他粒子不同;在该区域里,表达式收缩成3项的乘积。据称模型写了 Python,检查约5,000种可能,并自行选出了这种简化方式。
6点测试更具冲击力:32项、每项都包含嵌套乘积的表达式,收缩成了4项的乘积。“哇,好吧。这真的很漂亮。”研究人员这样回应。他们没有7点表达式,因为手工展开1个这样的表达式成本高到无法承受。
当被要求推断所有 n 的模式时,GPT-5.2 Pro 提出了一条复杂度按线性增长、而非阶乘增长的公式:粒子数翻倍,项数也只需翻倍。Lupsasca 认为,这就是 Parke–Taylor 公式的单负版本;但公开模型能猜出公式,却无法证明它。
一个更强的内部模型接到的是经过清晰表述的问题,没有候选公式,也没有低点数答案。12小时后,它独立重新发现了同一个表达式,并给出3步推导。论文在陈述结果之后的其余部分,本质上就是该模型生成的证明。
5. 科学主张独立于不寻常的发现手段
Lupsasca 对功劳划分得很清楚:人类发现了共线漏洞,并证明振幅不必为零;AI找到了简洁的通式及其证明。论文标题《单负胶子树振幅非零》把重点放在物理学上,而不是把工作包装成一次AI演示。
作者没有在摘要中提及AI,只在一段文字中交代 GPT-5.2 Pro 的猜想和内部模型的证明。Lupsasca 打了个比方:读者查阅几十年前的结果时,并不关心当年运行关键计算的是哪个 MS-DOS 版本,或用了几摞软盘。方法在历史上很重要,但不应遮蔽持久的物理学成果。
主持人提出了一个值得保留的质疑:从展示出的5点、6点公式走向通式,对研究生来说可能看起来很自然。Lupsasca 的回答是,证明来自一场没有任何极限情形提示的新会话,构成了独立检验;但他仍拒绝过早给论文排名,因为真正的影响力要由未来几十年的后续工作来衡量。
6. 公开版 GPT 将发现从胶子推广至引力子
引力子是引力波假设中的不可分量子,但没有任何实验直接测量到它们,正确的量子引力理论也仍未知。用场论语言说,胶子是自旋1粒子,引力子是自旋2粒子,偏振数据的某些方面翻倍,使数学问题实质上不同。
胶子论文发布3周后,团队发布了《单负引力子树振幅非零》。他们称,论文其实可以在第1篇发布约3天后就推出,因为 ChatGPT 就是这么快给出了答案;拖延来自仔细检查、撰写完善论文和补充背景。“大部分时间花在验证答案,而不是写作上。”Lupsasca 认为,1年前这还是荒谬的倒置。
这一次不需要内部模型。团队把胶子论文交给公开版 ChatGPT-5.2 Pro,强调其附录,说明引力问题需要的两处改动,然后说:“祝你好运。你是一名杰出的理论物理学家。”模型意识到,可以用有向矩阵树定理来组织新的计算——这是一套已知数学工具,但人类专家此前没有想到在这里使用它。
在一场110页的对话中,模型提出下一步、完成合理性检查、处理树求和与约化公式,并反复请求继续的许可。人类的回复往往只是“继续”,或者要求进行一项明确验证。Lupsasca 将这种工作模式称为“氛围物理”(“vibe physics”)。
7. 结果何时成为有意义的科学,仍取决于人类引导
人类判断依然清晰地体现在模型没有主动产生的部分。Strominger 撰写了更宽泛的引言;通用AI草稿没有解释结果为何重要。研究人员还单独发起了另一项研究,考察振幅在与天体全息和量子引力相关的对称性下如何变换。
但从第3节开始,Lupsasca 说,发表的引力子论文基本保持了模型草稿的面貌,数学部分由公开版 ChatGPT Pro 推导完成。因此,他的判断相当明确:这是“量子引力领域一项真正扎实的成果”,主要由AI产出,但问题由专家选择,工作由专家引导,每一步由专家核验,科学视角也由专家提供。
边界已经移动,但并未消失。AI如今解决了几位领域专家追踪一年的问题,但Lupsasca明确表示,它还没有解决一个让整个学界苦战几十年的问题。这是他想看到的下一个门槛。
8. AI压缩困惑,并把并行对话变成研究侦察兵
物理教育传统上把艰苦计算当作必经训练:学生学习技术,也证明自己能够熬过困难工作。教授们会把可处理的6至12个月问题留在手边,用来连接课程学习与研究。Lupsasca 怀疑,当前模型可以“碾碎”其中许多作业,使旧有训练结构变得不稳定。
但AI也能帮助学生穿过他所称的研究生课程与研究前沿之间的“沙漠”。它可以按所需层级拆解任何事实,连接陌生概念,避免数月无效困惑。尚未解决的问题是:当最强的导师也有能力替学生完成作业时,学生如何建立独立信心。
在Lupsasca自己的工作中,困惑耗费的时间已经大幅缩短。完成计算后,他可以询问这与另一个已知事实如何相容,立即听到自己遗漏了什么,或对问题的框架哪里有误;过去需要散步、转做其他项目、在思维堵塞中消耗数日的过程,如今变成快速纠偏。
AI也改变了探索方式。他不再需要把稀缺精力押在从A经过B走到C的一条路径上,而是可以同时开启10个对话,让它们沿不同方向成为高速“侦察兵”。即便不完美的侦察兵,也能指出有希望的地形并留下路标;沿着一条部分绘制出的路线前进,远比第1个闯入未知区域容易。
9. 技术能力的扩张速度快于科学品味
研究生进入物理学时,常问的问题包括:为什么空间有3个维度?大爆炸发生了什么?黑洞内部是什么?专业成熟意味着意识到,有些问题距离当前知识边界太远,无法有效切入;进步来自选择一个刚刚超出边界的问题。
Lupsasca 因此区分了能力与伟大。一个合格的物理学家可以学会问题所需的任何数学、代码或计算工具。“优秀物理学家与伟大物理学家的区别,在于知道该问什么问题”——这是最难的科学技能,通常也是最后才学会的技能。
当前模型像能力异常强的研究生:一旦给出精确问题,它们可能在计算上达到超人水平。但它们还不能稳定判断哪个问题值得追踪,因此人类品味仍居核心;而把问题、细节层级和表述方式匹配给学生的学术能力,也可以直接迁移到提示AI协作者。
这种优势可能只是暂时的。当Lupsasca把胶子论文的一页内容交给 ChatGPT Pro,要求它提出3个最佳后续方向时,模型给出的基本就是他的3个首选。他不愿透露内部正在进行的自主前沿发现工作,但表示,AI在选择问题方面已经强得出人意料。
10. 黑洞“Love”测试让这条轨迹变得私人化
主持人质疑,表面上的创造力是否只是重新组合。Lupsasca 回答说,人类发明也可能只是“一台栈式机器的重新组合”,而 GPT 给人的感觉像一名有创造力的协作者。他保留了一个异议基准:据他了解,Terry Tao 曾将看似有创造力的AI证明追溯至晦涩参考文献,尚未见过真正令人印象深刻的新颖数学步骤。
Lupsasca 对 GPT-5 的决定性测试,使用了他当时尚未公开的论文,主题是黑洞为何没有“Love”——Love 数衡量潮汐响应,黑洞响应为零意味着存在某种保护对称性。由于模型的训练数据截止时间早于论文发表,他只提供了控制方程,并要求模型找出其对称性。模型最初错误地回答说不存在任何对称性。
随后,他给出了一个显而易见的平直时空热身问题。GPT-5 Pro 在9分钟内正确解决了这个有着200年历史的问题,找到了3个生成元;在同一场对话中得到提示后,它又回到黑洞方程,并在18分钟内发现了新的对称性。“那就是我的第37步棋。”他说,那一刻,模型在不到半小时内复现了他最珍视的计算。
11. 低成本论文生成抬高门槛,也让验证变得稀缺
Lupsasca 认为,在专家引导下,对于接近已知工作的计算,模型已经能够每天产出1篇人类水平的论文。糟糕的问题同样能生成包装精美的胡言乱语,助长“AI垃圾内容”,并淹没 arXiv。学界再也不能把专业化呈现当成底层问题或推导可靠的证据。
他的应对不是发表30个单负论文变体。随着生产成本下降,重要性的标准必须提高。他希望以这些新振幅为切入点,逐步攻向更困难的量子引力问题,最终挑战那些让整个学界苦战几十年的难题。
静态论文本身也显得低效:AI完成计算,人类把它压缩成简短符号,结果又被重新输入AI展开。Lupsasca设想一种交互式论文:可以解释全局、放大某个推导,或展示数学家目前通常省略的直觉图景;同时保留写作迫使人澄清思路的有用纪律。
验证可能成为今年的主导瓶颈。Lupsasca 曾认为形式化证明系统不可或缺,后来自然语言推理进步到足以接近人类数学讨论;如今模型可以同时攻克数千个问题,返回多到人类无法检查的证明。因此,Lean 等系统中的形式化、自动检查,以及更清晰的模型置信度信号,又重新变得有价值。