先锋 趋势 方法 投研 作者
GPT 5.2 发布、2026年企业崩塌与110万份工作流失 | EP #215
返回节目精读

GPT 5.2 发布、2026年企业崩塌与110万份工作流失 | EP #215

摘要

  • GPT-5.2让前沿模型竞赛重新成为真正的较量,但Alexander Wissner-Gross认为,这次跃升很可能来自3个可以快速调节的杠杆:增加算力、改变安全设定,以及针对性后训练。 ARC-AGI 2在GPT-5.1 Thinking上的成绩从17.6%升至52.9%,AIME 2025则达到100%。但在研究级FrontierMath Tier 4上,Gemini 3 Pro仍以约19%领先GPT-5.2的14.6%:「比赛开始了」(The race is on),但还没有分出胜负。

  • 真正具有经济决定性的结果来自GDPval:在涵盖44种知识工作职业的1,320项任务中,GPT-5.2的成绩从38.8%升至70.9%。 在人机对比中,71%的情况下模型产出优于人类,速度超过人类11倍,专业劳动成本则低于1%。Wissner-Gross毫不设防的结论是:「知识工作完了」(Knowledge work is cooked)。

  • 企业采用AI受限的关键,与其说是原始能力不足,不如说是遗留技术、官僚体系,以及高管试图自动化昨天的工作流,而不是重建工作流。 Dave Blundin举例称,一套在遗留Java或C代码上表现不佳的软件,可以「完全从零用Python重建」,一小时内就能完成;Salim Ismail表示,其网络合作的20家大型企业中,只有大约3家做到了所需事项的一半。他的标题式预测是:「2026年将迎来商业史上企业世界最大规模的崩塌。」

  • 模型市场正变得高度分化、成本高昂,并且与供应链信任不可分割。 Claude Sonnet 4.5在长篇创意写作上领先,Gemini 3 Pro则更受商业文档用户青睐;Blundin预计,Claude Opus的月度支出会从200美元升至20,000–30,000美元,而单月生成的代码将超过他此前一生的总量。便宜的开放权重代码模型带来安全权衡:「你想要便宜的智能,还是想要安全的智能?」这将市场推向主权化、可信赖的AI技术栈。

  • 劳动力转型已经开始,但嘉宾预计,过程会先经历缓慢的官僚式启动,随后在一家AI原生竞争者的股票重估后陷入恐慌。 节目提到,2025年已宣布裁员110万人,西雅图有20,000名高能力科技从业者被释放,顶尖程序员的生产力则提升至10倍。Blundin认为,在部署进度追上之前,系统可能已经具备消灭80%–90%岗位的能力;嘉宾提出的应对方案包括前线部署AI团队、全公司文化变革、再培训,以及为期一年的UBI。

  • 算力主权正在固化为以美国和中国为中心的两套生态,持续制造对芯片、数据中心、电力和国产替代方案的需求。 据称,卡塔尔主权基金将向一个数据中心枢纽投入200亿美元,Microsoft则将在印度投入175亿美元;中国抵制进口NVIDIA H200,被认为是为了防止再次遭遇突然断供,属于理性保护。结果是「晶圆制造圈层与算力圈层」并立,本质上更像第二次冷战,而不是暂时性的采购争端。

  • 眼下最直接的AI卖铲人机会,可能在基础模型之外的相邻领域。 Boom将超音速发动机技术改造成42兆瓦数据中心涡轮机,在传统涡轮机交付等待期达到7年的背景下,积累了声称达12.5亿美元的订单积压;自动化「暗实验室」、垂直农场、机器人和轨道数据中心,则把同一轮需求继续向外延伸。对现有企业而言,战略问题非常直接:「你现在正在建设什么,眼下对你是成本中心,却能在AI生态中变成利润中心?」

精读

1. 分发能力正与前沿模型领导权同等重要

  • Peter Diamandis开场先给出分发数据:ChatGPT被称为2025年iOS下载量最高的应用,活跃用户接近9亿。另一张下载量图表显示,ChatGPT为9,200万、Gemini为1.037亿、Claude为5,000万;Anthropic的企业市场份额已达到40%,Accenture正准备让30,000名员工使用Claude。

  • Blundin对GPT-5.2的反应,重点不在基准测试标题,而在于此前无法完成、现在终于能完成的工作:「我上周完成的那些、3周前还做不到的事情……我感到震惊。」GPT-5令他失望后,他说预测市场一度认为Google将在年底前领先,概率达到90%–95%;GPT-5.2重新让比赛变得势均力敌。

  • Wissner-Gross拆解了这场竞赛背后的差异化战略:OpenAI想成为消费者默认的「核心订阅」;Anthropic强调企业API和代码生成;xAI偏好暴力扩展与「刷榜」;Google则追求更均衡的全栈控制。当用户达到约10亿时,助手界面可能开始「吞噬整个操作系统本身」,随后连同其上的应用生态一起被吞噬。

2. OpenAI手上有3个可以快速调节的GPT-5.2杠杆

  • GPT-5.1仅在一个月前发布,因此Wissner-Gross推断,OpenAI的「code red」应对可以动用大约3个杠杆:分配更多推理算力、调节安全旋钮——包括可能让模型变得更迎合用户——以及针对选定任务或评测强化后训练。

  • 他用人类学习作类比,区分了预训练与之后发生的事情。预训练类似婴儿吸收无监督感官信息并预测下一步;中训练和后训练则像学校,通过明确作业、评分、强化和评估塑造行为。他认为,过去一年模型能力中「几乎所有的alpha」都来自后训练,而不是预训练。

  • Blundin把有限访问额度解读为证据:实验室此前压制了模型能力,因为没有足够产能进行大规模部署。但竞争压力迫使它们放开限制,结果用户会遇到这样的会话结尾:「抱歉,今天你用完了。我们没有算力了。卖光了。油箱里没油了。」

3. GPT-5.2推理能力大幅跃升,但没有在硬数学上击败Google

  • 部分提升属于渐进式改善:GPT-5.1在GPQA Diamond上的成绩为88.1%,GPT-5.2升至92.4%;软件工程成绩则被形容为幅度有限。AIME 2025从94%升至100%,Wissner-Gross认为这尤其像针对性后训练的结果。

  • FrontierMath Tier 4仍是OpenAI无法实现干净胜利的反例。该基准测试的是研究级数学问题,目标是让职业数学家花上数周时间;Gemini 3 Pro得分约19%,GPT-5.2 Thinking为14.6%,GPT-5.1 Thinking为12.5%。尽管OpenAI曾资助该基准的创建,并且按Wissner-Gross的说法拥有异常良好的接入条件,OpenAI仍未能领先。

  • ARC-AGI的提升幅度大得多。ARC-AGI 1从72.8%升至86.2%,引发了它基本已经「被做完」的判断;ARC-AGI 2则从17.6%跃升至52.9%。后者被描述为前沿级进展:题目对人类刻意设计得很容易,却长期让机器难以解决。

  • Blundin把这一结果送给那些曾把ARC-AGI 1视为机器智能缺少某种根本性要素的学者:「现在看起来很蠢了吧。」仅仅几周后,该基准就接近饱和。

4. GDPval把模型进展转化为劳动力市场判断

  • GDPval旨在测试44种职业和1,320项专业任务中的知识工作,包括制作PowerPoint演示文稿和Excel表格。GPT-5.1得分38.8%,GPT-5.2升至70.9%。

  • Blundin直接把分数翻译成现实含义:在71%的对比中,GPT-5.2产出的工作优于人类专业人士,速度超过人类11倍,成本则不到1%。他反复强调这一结论:「知识工作完了。」

  • Diamandis把这项基准测试与Elon Musk提出的「Macrohard」概念联系起来:模拟一家公司的员工,再把他们合计产生的产出作为服务出售。警告不只是自动化已经可能,而是高管没有预测「这件事会以多快的速度发生倾斜」。

5. 遗留接口掩盖了已有多少工作可以被自动化

  • Blundin发现,企业往往用对模型最不友好的版本来测试自己的问题。一家公司使用Java;另一套遗留代码库涉及C,模型在上面表现很差。他给出的替代方案是绝对性的:「扔掉它。从零开始完全用Python重建。一个小时后回来,它就完成了。」

  • 当Outlook文件夹、邮件安全层或接收界面阻碍自动化时,运营团队也犯了同样的错误。他们本可以用大约一天修好前端,再测试剩余工作流,却把这个小小的边缘案例当成整个系统不可用的证据。

  • 更广泛的落地缺口,本质上是架构问题。模型可能已经「碾压了问题」,但现有企业仍要求模型保留每一项遗留依赖、权限系统和流程,而不是围绕新能力重新设计。

6. 智能成本正在超通胀式下跌,但基准测试成绩并不均衡

  • ARC-AGI的结果意味着,相比2024年的o3,效率提升了390倍,远超嘉宾反复提出的每年40倍「超通胀式通缩」假设。Wissner-Gross强调,有用的进展必须「向左上方移动」:性能更高、成本更低,因为「如果丰裕不可负担,那还有什么意义?」

  • 成本曲线也区分了效率提升和暴力计算。GPT-5.2在ARC-AGI 1上的位置,似乎与GPT-5 Mini处于同一条外推斜率上,这意味着它可能只是投入了更多算力——「用后背发力,而不是用腿发力」。相比之下,ARC-AGI 2展示了他所谓的激进改善。

  • 模型领导权仍然是「尖峰式」的。Claude Sonnet 4.5赢得了约8,000字长篇创意写作基准测试,据称评审者是Sonnet 5;而Diamandis和Wissner-Gross在商业写作上更偏好Gemini 3 Pro。没有任何单一系统主导所有类型的输出。

  • 当被问到纯粹扩展规模是否足够时,Wissner-Gross的答案大概是肯定的:冻结今天的算法,增加足够的推理时算力,模型可能会聪明到能够自行设计更优算法。现实开发会同时带来规模扩展和新方法,但「到这个阶段,我们能不能只靠扩展规模?我的猜测是,大概可以。」

7. 廉价开放权重代码带来昂贵的信任问题

  • Blundin在自己的NVIDIA硬件上运行Kimi K2,用Gemini 3 Pro给输出「去间谍软件」并校对,同时高度依赖Claude Opus。他的Opus账单已从每月约200美元升至1,000美元,并正逼近20,000–30,000美元;但他预计,那个单月生成的代码会超过自己余生之外此前全部人生的总量。

  • Wissner-Gross警告称,公开研究发现,某些政治敏感提示词可能导致部分开放权重模型生成更多存在漏洞的代码。在人类能够管理的产出量下,Blundin原以为自己可以检查输出;但一周后,工作软件以「任何人类都不可能全部看完」的数量涌来。他承认:「我完全错了。」

  • Blundin可能采取的做法,是停止让Kimi承担这类工作,转而支付大约20倍的价格,让GPT-5.2负责验证或生成。嘉宾把选择描述为结构性问题:「你想要便宜的智能,还是想要安全的智能?」

  • Mistral的Devstral 2提供了一个欧洲式的替代方案,被戏称为「欧洲:慢,但可信」。但据称,需要自托管模型的硅谷公司正在使用Qwen。仅靠社区人才,可能无法重现Linux式的开源统治力,因为真正的约束是算力:「让bug变浅的方法,是投入数万亿美元资本开支。」

8. 2026年的企业分野,在于原生重建者与陷入瘫痪的现有企业

  • Ismail表示,大型企业被替换自身系统所带来的政治和情绪压力「完全压垮」。可行的架构是先在边缘构建AI原生技术栈,再逐步淘汰遗留核心,把职能、资源和能力转移到新组织中。

  • 在其网络合作的约20家大型企业中,Ismail估计或许只有3家做对了50%的关键事项。其余企业认为,既然过去总能追赶上来,就可以继续延长旧模式。他的答案是:「绝对不行。」

  • 一家AI原生初创公司可以以接近现有企业百分之一的成本进入其市场,同时拥有10倍的创新速度。这种不对称关系支撑了Blundin的预测:「2026年将迎来商业史上企业世界最大规模的崩塌。」

  • 一些高管选择退休。嘉宾认为,这是一种罕见的诚实——承认自己无法驾驭新环境;但他们同时警告,既不适应也不离开的领导者,会变成阻挡变化的「老古董」。

9. 现有企业可能必须资助自己的外部颠覆者

  • Blundin的处方来自《创新者的窘境》:找到Link Studio、Y Combinator或Neo公司,投资它们,或者成为它们的开发客户,再让一家边界清晰的外部初创公司解决内部问题。当签约奖金可能达到10亿美元级别时,现有企业不可能简单地雇到所需人才。

  • Ismail回忆说,Clay Christensen曾承认,他的框架更擅长诊断结构性裂缝,而不是提供解决方案。Uber暴露了其中一个弱点:把交通、医疗、食品和配送视为稳定的垂直行业,忽视了平台可以横向跨越这些领域。Peter随后把旧有分类概括为向单一类别坍缩——算力。

  • 更不加掩饰的替代方案,是进行一笔200亿美元的收购式招募,再新增140亿美元工资支出。无论走哪条路,都接受同一个前提:保留现有组织架构,不是获得前沿能力的可信战略。

10. Meta必须在3种互不相容的AI身份之间做选择

  • Blundin为Meta转向模型蒸馏和高速推理辩护。Llama 4在基础模型上已经落后,但更快的推理可以支持更多智能体并行工作、更大的迭代循环,并可能实现自我改进,让Meta重新回到前沿。

  • Wissner-Gross看到了3种相互竞争的战略:通过Llama把生成式AI成本推向零,从而商品化互补品;用强AI改善Instagram和Meta现有产品;或者通过封闭API模型,直接与前沿实验室争夺超级智能。他怀疑,Meta内部不同利益群体分别支持这3条路线。

  • Meta之所以能够进行140亿美元的AI人才大采购,是因为其核心业务持续产生现金。嘉宾指出,华尔街已经容忍公司「每一分钱」加上债务都投入AI,却没有因此惩罚股价。Diamandis认为,真正的挑战是重塑商业模式,而不仅仅是追赶技术。

  • 节目的讽刺之处在于,Sam Altman曾公开表示,宁愿拥有10亿用户而没有前沿模型,也不愿拥有前沿模型而没有用户;而Meta已经拥有10亿用户级产品,却急切想要前沿模型。「另一家前沿实验室的草总是更绿。」

11. 自动化实验室把科学发现变成推理循环

  • Diamandis描述了「熄灯运行」的设施:AI提出假设、设计实验,再指挥机器人连夜执行;随后利用得到的数据确认或修正假设,速度比人类实验室快数千倍。

  • Ismail称自动化实验室是「自科学方法发明以来,科学进步最大的突破」。继「暗厨房」和「暗工厂」之后,接下来是「暗实验室」,研究周期持续运转,不再等待人类轮班。

  • Wissner-Gross认为,超级智能之后的材料发现,将与数学、科学、工程和医学问题的解决并列。更好的半导体和超导体会直接反哺更强算力,因此自主材料科学将加速递归改进的「最内层循环」。

12. 合成演员会先抢走预算,再去争奥斯卡

  • 据称,AI生成女演员Tilly Norwood耗时6个月、经历2,000个设计版本,10月YouTube播放量超过700,000次,签下经纪人,并据报道吸引了约40份电影或开发合同。Wissner-Gross把这一轨迹与电影《S1m0ne》相提并论,并追问观众到底需要多少真实性。

  • Blundin的答案是:「没有我们以为的那么多。」他把好莱坞的自信,与《华盛顿邮报》记者曾经相信消费者会因为其真实的人力投入而继续为优质报道付费相比较。结果崩塌的速度远超他们预期。

  • 他对好莱坞所选基准的反驳更加尖锐:演员会等到一部全AI电影出现,但观众时间和预算已经转向电子游戏与短视频。「当Tilly出现在50亿条TikTok帖子里,你就知道自己完了」——这会远早于AI演员登上影院大银幕。

  • OpenAI把Disney角色带入Sora 2的协议,被描述为一笔10亿美元投资和为期3年的授权安排,暗示了授权身份的近期市场。Diamandis认为,现有演员可能需要尽早发布获授权的数字化身,以免合成角色先占据观众真正有亲近感的有限人物池。

13. 全国性AI规则获得共识,宪法崩塌没有

  • 嘉宾大体支持通过行政命令排除州级AI法律。Blundin不喜欢放弃州层面的差异,但认为全国框架不可避免;例如纽约通过后代限制已故人士的AI肖像权时,「你要怎么把它挡在纽约之外?」

  • Wissner-Gross从州际商业角度论证:模型可以在一个州训练,再向多个州提供服务。拼凑式监管会造成「彻底混乱」,削弱国际竞争力;而该行政命令与芯片、能源和数据中心领域的联邦政策方向一致,共同服务于超级智能竞赛。

  • 随后Blundin预测,随着隐私等条款失去效力,整个美国宪法将在5年内「蒸发」,并呼吁由「创始模型」自下而上重写宪法。Diamandis明确反对:「我一秒钟都不相信这个预测。」

14. 裁员之后将展开重新配置人才的竞赛,而不仅是清除岗位

  • OpenAI的职场研究覆盖100家公司、9,000人:用户称每天节省40–60分钟,75%的人表示AI让工作更快或更好。节目同时提到,2025年已宣布裁员110万人,是自2020年疫情以来最多的一年。

  • Blundin转述LendingTree CEO Scott Perry的观点:Microsoft和Amazon释放出的20,000名高能力人才,创造了西雅图记忆中最好的科技招聘机会。AI让他最优秀的程序员生产力提升约10倍,因此即使产出增加,所需员工数量仍然下降。

  • 他的预测区分了能力与推广速度:模型可能具备消灭80%–90%岗位的能力,但监管和企业官僚体系决定时间表。采用初期会很慢;随后某家竞争者的股价上涨10倍,董事会要求复制同样结果,「羊群效应就会反转」。到2026年末,他预计那些延迟行动的公司会陷入恐慌。

  • Diamandis预计再培训咨询将形成一个大市场,但Ismail反驳称,仅有技能还不够,企业需要更深层的全公司思维转变。他举了一个家族企业的例子:公司取消了1,000个岗位,却资助为期一年的UBI,让员工寻找新的出路;Blundin则强调,应把被裁的科技从业者重新培训为前线部署AI专家,进入银行、零售商和其他现有企业。

15. 算力主权正把世界分成持久性阵营

  • 数据中心建设已经成为国家政策:据称,卡塔尔主权基金将向一个区域枢纽投资200亿美元,Microsoft则承诺向印度的AI就绪云基础设施投入175亿美元。Wissner-Gross把这一趋势压缩成一句话:「用主权推理时算力铺满地球。」

  • 中国试图限制NVIDIA H200采购,尽管美国已经批准出口,被解读为信任决策,而不是简单拒绝更好的芯片。中国在禁运期间已经投资国产制造,无法冒险重新开放H200进口、让本土供应链崩溃,再次面对断供。

  • 结论是两套大体独立的生态,欧洲和印度则是部分变数。Wissner-Gross称其「几乎像第二次冷战」:势力范围现在包括「晶圆制造圈层与算力圈层」,而最初的芯片禁运已经让信任难以恢复。

16. AI电力短缺奖励转型速度,而不是企业出身

  • Boom的42兆瓦天然气涡轮机,把为超音速飞机开发的技术改造成现场数据中心电力方案。在传统燃气轮机等待期达到7年的背景下,Wissner-Gross称这是一次出色的转型,切入的潜在市场可能比消费级超音速飞行更大。

  • 公司声称订单积压达到12.5亿美元,运营商据称愿意为未来交付预付款。Diamandis认为,短期涡轮机收入可能提高Boom最终完成原始飞机项目的概率,就像AWS曾为Amazon更宏大的目标提供资金,或Starlink支持SpaceX的长期目标。

  • Blundin把这个案例进行了概括:一家飞机公司本来就拥有叶片、制造能力和与发电相邻的冶金专业。在AI经济中,邻近能力加上速度,可能比原有企业身份是否看起来匹配更加重要。

  • 中国核电建设成本为每瓦2美元,美国则为每瓦15美元,问题最终又回到审批许可。Wissner-Gross认为,约束来自联邦、州和地方层层叠加的限制,而不是物理规律;Diamandis预计这些障碍会被清除。节目最后再次提出战略问题:「你现在正在建设什么,眼下是成本中心……却能变成利润中心?」

17. 机器人将超越双臂人形模板,走向多样化

  • Ismail反复强调,机器人不必局限于2条手臂。Wissner-Gross指出,人形外观有助于适应由人类设计的空间,但预计机器人形态将迎来一次「寒武纪大爆发」——更多手臂、腿、头部和不同形态,演化史上已经探索过其中许多方案。

  • 自动化垂直农场体现了专业化方向:嘉宾提到,其产量是传统农业的7–9倍,淡水使用量减少99%,不使用农药或化肥;按照测算,35栋曼哈顿摩天大楼就能以可持续方式养活这座城市。美国一顿饭平均运输2,400英里,农业消耗70%的淡水,本地化自动化改变的不只是种植,也包括物流。

  • Wissner-Gross指出,节目展示的农场视频似乎来自中国政府,这意味着精致的机器人演示也成为一种新的软实力。系统本身使用受控光照、灌溉、pH监测、AI成熟度检测和全天候机器人采摘。

  • 嘉宾对人形零售店员更加怀疑。有一种预测认为,他们至少还需5年才能进入便利店运营;也有人认为,配送无人机可能会先让便利店消失。不过,Boston Dynamics与Hyundai的连接,仍然支撑着按汽车产量制造人形机器人的 ambitions:「我们不需要数十亿辆汽车,但确实需要数十亿个人形机器人。」

18. 智能正在进入身体,也正在进入轨道

  • Pebble创始人Eric Migicovsky早年的Kickstarter经历显示,消费硬件可以在生产前获得市场验证:当时目标融资约100,000美元,最终收到1,000万美元订单。他的新款75美元戒指把交互简化为一个按钮:记录想法,再发送给手机上的端侧模型进行转录和分析。

  • Wissner-Gross称,这相当于「给人体增加一个按钮」,用来与基础模型交流。Blundin预测,2年内会出现可吞服的基础模型,并提出在乳突骨附近设置麦克风和扬声器;Diamandis回忆说,《Shark Tank》上也曾出现过类似植入式设备的想法,而Blundin认为,硬件在体外迭代的速度会快得多。

  • Starlink Direct to Cell在智利提供服务,把同样的去物质化趋势延伸到电信领域。Ismail认为,一家私营公司现在可以建设联合国或政府在结构上无法提供的基础设施,可能绕过对4G和5G地面网络的巨额投资。

  • 因此,接口趋势并不是某个设备取代另一个设备,而是智能正在逃离应用屏幕,进入可穿戴设备、潜在的植入物、卫星、合成人物和持续在线的自动化物理系统。

19. 轨道数据中心在数月内从边缘提案变成CEO路线图

  • Diamandis强调了这次相变的速度:9个月前,轨道算力几乎还没有进入讨论;如今,中国、欧洲和美国的公司突然都在推进相关项目。Sundar Pichai表示,Google计划在2027年把「微型机架」送入轨道,并预计大约10年后,太空数据中心会变得稀松平常。

  • Wissner-Gross称,初始设备将基于TPU,并建议Google可以搭乘SpaceX的发射服务,借助Planet Labs卫星进入轨道。稀缺资源将变成太阳同步轨道:持续日照支持太阳能发电,但许多运营商会争夺数量有限、且必须保持安全间隔的轨道路径。

  • 在嘉宾纠正Gemini此前的估算后,散热看起来不再那么难。Blundin称,每平方米太阳能板只需要约一平方米的铝基辐射散热面积,而不是10平方米;只要把散热器朝向深空,「它就是彻底可行的」。Wissner-Gross称,这条轨迹正「梦游般直奔戴森群」。

  • 容错仍是尚未解决的问题,而不是不可能的问题:方案包括抗辐射半导体、电路级冗余、太阳风暴期间关机、快速重启,以及地理位置上的多元化——最终可能扩展到整个太阳系。Blundin补充说,轨道数据中心芯片本来每3年左右就会更换一次:「发射、回收、再发射、再回收」,而不是期待单个平台运行数十年。