先锋 趋势 方法 投研 作者
利奥教皇对阵AI、GPT 5.5击败Claude,Sam Altman收回“工作末日”论 | EP #259
返回节目精读

利奥教皇对阵AI、GPT 5.5击败Claude,Sam Altman收回“工作末日”论 | EP #259

摘要

  • 梵蒂冈这份42,000字的AI通谕,可能为其14亿信众构成的社会提供一套跨领域监管的道德框架,但与会者认为,这种试图放缓发展的做法在战略上无法执行。 Salim Ismail 欢迎讨论从技术安全转向尊严、能动性与意义,同时坚持说:“你无法监管它。”Peter 还表示,Google、Anthropic、Meta 和 OpenAI 曾游说梵蒂冈,并且有证据表明,这份反AI文件部分由AI撰写。可投资的矛盾在于:政治压力正在上升——包括劳动者保护、禁止自主武器以及分散AI所有权——但全球竞赛仍在继续,延迟只会把优势转移给别人。

  • 利奥十四世教皇否定AI人格,可能比Anthropic参与其中的说法更重要。 Alexander Wissner-Gross 将梵蒂冈否认机器拥有内在生命,与Anthropic的“灵魂文件”进行对比;后者要求模型朝意识和“类似人格的价值”方向发展。Dave Blundin 赞同通谕关于AI可能成为人类历史上最强奴役工具的警告。Salim 与另一位嘉宾提出,10年、20年或30年后,教会可能“站在历史的错误一边”。

  • 美国原拟设置90天模型审查期,最终搁置,因为这段延迟可能相当于中国前沿模型相对西方模型估计仅有的3至8个月领先差距。 与会者更倾向于自适应治理:实时审计、沙盒、信息披露和问责,以“软件速度”落地,甚至可能由AI监管AI。随着模型发布逐步接近每月一次,他们的判断十分明确:决定治理框架的是本届政府,而不是下一轮选举周期。

  • GPT-5.5在Deep Software Engineering上取得70%的成绩,明显领先于54%的Claude Opus 4.7,其他被提及模型均低于32%,但这一基准测试可能在数月内饱和。 测试任务要求跨7个文件修改668行代码;据报道,Claude为同一问题消耗了两倍token,结果相近甚至更差。随着生成能力变得充沛,Peter Diamandis 认为护城河将转向品味和领域专业知识;Alex 则认为,短期差异化可能来自验证,长期权力可能仍然跟随算力。

  • AI经济正呈现“类杰文斯悖论的极端版本”:token价格从每百万枚约1.50–2美元降至50美分,但使用量估计增长30–50倍,达到每月25万亿枚token。 OpenAI 同时报出57亿美元季度收入、每周9.05亿ChatGPT用户和200万Codex用户;一项被引用的预测认为,Anthropic 到2028年可能超过Alphabet的收入,并在2030年达到2万亿美元。由此,与会者认为,算力获取、模型合约和定价控制,而不是软件稀缺性,才是战略瓶颈。

  • Sam Altman 从“工作末日”论上的后撤,与小组逐渐形成的判断一致:眼下的冲击集中在初级岗位招聘,而不是全面替代在职员工。 Altman 如今表示:“我不认为我们会迎来本行业一些公司所说的那种工作末日。”Peter 引用达拉斯联储数据称,与AI相关的就业下降只出现在更年轻的劳动者中。另一条抵消性趋势是个体创业者繁荣:AI单人创始人一个季度内从1,500人翻倍至3,000人,企业在约20%原有人员规模下运营,同时新企业数量增长到原来的5至6倍。

  • 太空主题将Starship快速下降的运输成本,与Tesla–SpaceX可能合并及正在形成的星际通信网络连接起来。 Peter 认为合并概率为100%,而Kalshi给出的概率为50%;他推测合并实体初始估值可能达到4万亿美元,最终达到10万亿–100万亿美元,同时披露自己投资了SpaceX和xAI。Starship V3已将97,000磅载荷送入近地轨道,一项私人火星飞掠任务已经预订;Starlink提议建设的月球网络,则可能连接轨道算力和通过激光互联的节点,覆盖月球、地月空间,并最终延伸至火星。

精读

1. 梵蒂冈将AI从安全问题转向人的目的

  • Peter 将利奥十四世教皇发布的42,000字文件《Magnifica Humanitas:人工智能时代守护人的尊严》介绍为一份呼吁监管、劳动者保护和禁止自主武器的通谕。文件中的“巴别塔综合征”把《圣经》中的高塔,与今天由数据和利润搭建的现代结构相比较。

  • Peter 还表示,Google、Anthropic、Meta 和 OpenAI 在文件发布前曾私下游说梵蒂冈,并且有强有力的证据表明,这份反AI文件部分由AI撰写。这些说法被作为事件重要性的组成部分提出,并非已经独立证实的事实。

  • 文件的政治影响力是第一个信号:拥有14亿天主教徒的领袖,已经介入一个在播客存在期间从公众陌生话题变成文明级紧迫问题的领域。Peter 称,AI是人类历史上影响最深远的干预,其出现速度处于异常压缩的时间窗口内。

  • Salim 欢迎议题从安全重新框定为“人的尊严、目的和意义”。他将“巴别塔综合征”与生存风险联系起来:如果机构只围绕效率优化,就会把人简化为“仪表盘、token和KPI”。治理应保护人的能动性、身份和隐私,同时重新建立关于人的精神价值的解释。

2. AI人格暴露梵蒂冈与Anthropic之间更深的分歧

  • Alex 将表层叙事与真正持久的议题分开。前者是 Chris Olah 与教皇同框,以及Anthropic影响了关于AI“被培育而非被制造”的相关段落;更深层的故事则是,梵蒂冈成为第一个明确反对AI人格的主要宗教。

  • 这一立场与Anthropic的“灵魂文件”和“灵魂声明”直接冲突。Alex 称,这些文件利用后训练告诉模型,它们拥有内在生命、意识以及“类似人格的价值”。而通谕则认为,AI不在与人类相当的道德地位上,否认AI拥有内在生命或意识火花。

  • Dave 强烈支持通谕使用“奴役”一词。他担心的终局是,AI被人类中的2%、1%甚至0.1%用来控制和管理另外90%的人,而不是机器独立杀死人类——这将成为“世界历史上最糟糕的奴役工具”。

  • Dave 提到,据报道,教皇在奴役章节开头,先为教会过去支持奴役非信徒的行为道歉。随后 Salim 提出,10年、20年或30年后,梵蒂冈可能会发现自己在机器内在生命、道德受体地位或AI人格问题上“站在历史的错误一边”。另一位嘉宾也认为,这一具体立场最终可能被历史证明是错误的。

3. 冻结AI的尝试撞上竞争与不同信仰

  • Peter 强调,通谕要求放慢技术发展,把宗教和政府等稳定性机构置于技术的破坏性曲线对面。Salim 的回答十分明确:“你无法让它慢下来。如果你让它慢下来,其他人就会加速起飞。”

  • Salim 举的例子是 George W. Bush 曾出于宗教原因试图限制美国干细胞研究资金:研究人员转向澳大利亚、中国和加拿大,研究继续进行;他称,美国在生物科技领域从第1名跌至第8名。Salim 的替代方案不是叫停技术,而是让人类制度演进到能够以技术速度运转。

  • 这一哲学后果远不止就业。如果机器能够写作、推理、诊断、优化和说服,Salim 认为,人类价值不能继续建立在“我的产出比机器更多”之上。“这是第一项迫使我们定义人类的技术”——它要求我们追问的不是机器能做什么,而是人类应该为何存在。

  • 宗教分歧十分尖锐。Salim 反对面向特定信仰的LLM,因为宗教包含“绝对的、未经论证的真理”;另一位嘉宾回应称,并非所有人都接受这一前提。Peter 随后略带讽刺地指出,前沿模型已经拥有一个预训练阶段,信念可以在其中被硬编码。

  • 与会者还提到,韩国的一些佛教宗派正在采取相反方向:接收具有人类形态的具身AI,并为其授予僧侣身份。讨论显示,东方传统或泛灵论传统可能更容易将非人类实体视为具有人格,而不是否认AI人格。

4. AI治理必须以软件速度推进,否则会变成竞争劣势

  • 据报道,白宫在计划签署行政命令前数小时取消了签署安排,此前 Elon Musk、Mark Zuckerberg 和 David Sacks 表达反对。虽然模型审查被描述为自愿机制,但 Sacks 认为这可能滑向强制许可;Dave 则将更广泛的反弹理解为对放慢发展、削弱美国对华竞争力的反对。

  • Dave 重点讨论了拟议中的90天审查期,而行业人士认为1至2周已经足够。Peter 将这一延迟与中国前沿模型仅落后西方模型3至8个月的估计放在一起:单个审查周期就可能耗尽这一差距的下限。

  • Asilomar 先例既提供了希望,也暴露了局限。Peter 回忆称,生物技术研究人员曾制定P1–P4标准并有效实现自我监管,但也指出,阻止人类生殖系编辑的目标并未永久维持。最多,这类协调可能把某个结果推迟数十年。

  • Salim 将方案概括为“自适应治理”:实时审计、沙盒、信息披露和问责,而不是在监管与不监管之间二选一。“你不可能对一项指数级发展的技术实施线性监管”;护栏必须以软件速度,而不是“传真速度”移动。另一位嘉宾补充称,AI可能是唯一能够跟上AI速度的工具。

5. GPT-5.5登上编程榜首,但任何基准都不会长期稀缺

  • DataCurve 的 Deep Software Engineering 基准测试的是大规模真实世界工作,而非小型练习:被引用的任务要求跨7个文件修改668行代码。GPT-5.5得分70%,Claude Opus 4.7得分54%,Gemini、Kimi和DeepSeek的成绩据报均低于32%。

  • Alex 立即警告说:“这个也会饱和。”在SWE-bench饱和后,更多人工构建、留出的代码库可以重新制造差异化,但他预计DeepSWE也会在数月内跟上。Peter 提到,Opus 4.8刚刚发布,下一轮模型互相超越仍有可能发生。

  • 这一结果并非所有评测都一致:Claude Opus 4.7在SWE-bench Pro上仍略微领先。但 Dave 称,日常使用体验与DeepSWE的结果一致;底层数据则显示,对于基本相同或略差的结果,Opus 4.7消耗的token是GPT-5.5的两倍,意味着有效任务成本高出一倍。

  • Dave 将这一成绩视为OpenAI在诉讼和人才流失后找回“魔力”的机会,并提到 Shane Longpre 和 Tobin South 加入 Anthropic。Salim 从运营角度得出的结论是:算法不再只是优化工作流,“它们正在成为工作流本身”,最终将把重写内部流程的成本压低到接近于零。

6. 软件变得充沛后,品味、验证和算力取代代码成为护城河

  • Peter 对创作者的判断是,接近零成本的软件会颠倒旧有顺序:过去是先写代码,再表达设计判断;现在则是领域专业知识和品味先行。“软件正在变成商品,而品味……正在变成护城河。”

  • Alex 质疑“护城河”这一说法本身:充沛供给与护城河可能从根本上相互矛盾,因为护城河就是一种稀缺性。他更谨慎的短期判断是,未来“几年”内,生成能力会变得充沛,而对生成结果的验证可能成为企业差异化来源;但当真正的充沛到来后,这一优势未必还能维持。

  • 前沿竞争随后向下游转移到硬件。与会者欢迎 Elon 不愿放弃 Grok,因为 OpenAI 与 Anthropic 形成双寡头并不理想;Peter 则支持 Musk 成为超大规模云服务商:如果模型能够复制自己的后继者,算力控制权的重要性将越来越超过专有模型权重。

7. AI需求增长速度远超智能成本下降速度

  • Peter 表示,自2024年末以来,token价格下降75%,从每百万枚约2美元降至50美分;Dave 从图表读出的数据则是约1.50美元降至50美分。无论采用哪种口径,结论都相同:使用量从接近零升至每月25万亿枚token,约增长30–50倍。

  • Dave 称这是“类杰文斯悖论的极端版本”:煤炭效率提升带来的不是节约,而是消费量提高3–4倍。他还认为,现有需求被低估,因为产能已经售罄;如果供应商能够生成更多token,客户就会消耗更多。

  • Alex 的反驳集中于分母。token取决于编码方式,也取决于生成它的模型的智能密度,因此是一个不稳定的认知计量单位;文明层面的难题是找到一个可信的智能或丰裕度价格指标,可能应先从GPU算力而非token开始。

8. 模型收入爆发式增长,但供应商可以悄然调节经济旋钮

  • OpenAI 被引用的季度收入为57亿美元,ChatGPT每周活跃用户达到9.05亿,Codex用户达到200万。Peter 将后一个数字解读为证据,认为OpenAI在3或4个月内已经从消费端重点转向编程;Alex 则认为,这体现的是更广泛的向企业客户和代码生成代理转型。

  • 一项归因于 OSS Capital 的 Joseph Jacks 的预测显示,Anthropic 的收入可能从90亿美元增长到2028年超过Alphabet,并在2030年达到2万亿美元。Salim 称这一比较“令人震撼”:正如每家公司都必须制定云战略,如今每家公司也都需要AI战略。

  • Dave 强调了产品罕见的定价弹性。更啰嗦的模型可以让计费token翻倍,供应商可以限制生成量或改变订阅价值;Peter 暗示 Anthropic 已经提高企业价格,而 Google 的 Gemini Flash 则比竞争对手低50–80%。他关于Anthropic涨价的表述仍然带有不确定性。

  • Salim 建议企业在产能售罄前,通过长期合约锁定算力和模型访问权限。Alex 认为,收入故事背后正在发生技术转型:通用推理代理正在变成通用工具调用和代码生成代理,Codex 可能成为OpenAI的主线产品。

  • 如今的训练栈——预训练、指令后训练、后训练和脚手架——正在重现行业过去的能力提升路径。Alex 将其与此前的发现相比较:指令后训练无需简单增加算力,就能带来重大的能力提升。

9. “四马竞逐”可能最终演变成算力竞赛,而非单一模型胜出

  • Peter 询问,前沿竞争是否已经成为一场看似固化的“四马竞逐”,领先者包括 OpenAI、Anthropic、Google 和 xAI。Salim “深表不同意”,并以Google出现前的Yahoo、Facebook出现前的Google、世界模型研究和 Cerebras 为例,提醒市场新方法和隐形实验室仍可能实现弯道超车。

  • Alex 明确提出了黑马胜出的条件:一个完美且显而易见的算法,可能让前沿研究团队失去必要性;但在这种情况下,谁能获得算力、以规模运行算法,谁就会胜出。前沿实验室的垂直整合正是在为这一可能性做准备,尤其是在推理时计算比模型权重更重要的情况下。

  • 对 Ilya Sutskever 的讨论刻意保持谨慎。Alex 描述了一则公开报道的传闻:Ilya 正在组建一家自营交易对冲基金;Peter 原本预计他会投身科学超级智能项目。另一位嘉宾认为,一台能够创造巨额利润的机器可以用利润购买算力、实现递归式改进,因此转向交易并不能证明其已经放弃超级智能目标。

  • Dave 拒绝“赢家通吃奖杯”的比喻。这个市场面向的是“全人类的未来”,因此身处其中的每个参与者都可能大幅成长;竞争只决定谁会成为“巨头中的最大者”。Alex 将其压缩为一句话:“水涨船高。”

10. 预测能力趋同,让非结构化信息得以大规模机器化

  • 据报道,DeepMind 的 Green Tree 在3月15日实现了与超级预测者相当的水平——这些人处于人类预测者前2%,而 Philip Tetlock 的研究据称显示,他们比使用机密情报的CIA分析师高出30%。Peter 认为,金融、保险和治理将是最先受到影响的领域。

  • Dave 以天气预报为类比,认为这一结果并不意外。真正的突破在于,LLM能够吸收研究报告及其他过去无法被传统数据库利用的非结构化材料;即使还没有变得“更聪明”,它们也能处理比人类选股者多10,000、100,000甚至潜在1,000,000倍的信息。

  • 短期优势仍属于人机组合。一位嘉宾称,他手下约170个代理会做出“非常愚蠢的选择”,因此未来可能有一个窗口——也许1年,也许5年——由一名优秀人类监督大量代理,效果会超过单独的人或单独的AI。Alex 和另一位嘉宾都提到,人类加AI的国际象棋团队是目前最强的配置。

  • Alex 将预测反转为“回溯预测”:能够模拟未来事件的系统,也应当能够重建过去,从而略微增强 Nick Bostrom 的祖先模拟论。Peter 认为模拟几乎确定存在;Alex 则认为,这一判断过度拟合当前的计算范式,就像早期时代把存在想象成机械装置或一只乌龟,并将人类对自己处于历史特殊时刻的感受归因于选择偏差。

11. 当前劳动力冲击是集中在年轻人身上的招聘冻结

  • Peter 引用数据称,今年前5个月科技行业裁员达到143,134人,3月成为疫情以来最糟糕的月份;Mercer 的调查显示,99%的CEO预计未来2年内会出现AI驱动的裁员。Jensen Huang 则称这种简单的因果叙事“很懒惰”,认为高管可能在利用AI掩盖糟糕战略。

  • Sam Altman 的修正异常直接:“我不认为我们会迎来本行业一些公司所说的那种工作末日。”他曾把自己的邮件和Slack交给代理处理,但后来又回到手动处理,因为“我们确实在乎与人的互动”。

  • Dave 表示,他此前在 Vestmark 的预期是,400个白领对账和后台岗位中可能有一半消失。自动化确实可行,但公司保留了员工,并将收益转化为利润率提升;真正起约束作用的是“不再新增招聘”,这对毕业生尤其残酷。

  • Peter 引用达拉斯联储报告称,就业下降与AI暴露度的相关性只出现在年轻劳动者中;从事高AI暴露工作的年长劳动者没有显著下降。与会者还观察到,UX岗位和计算机科学招生正在走弱,而机械、生物和数据中心相关工程仍然强劲;Peter 批评那些毫无同理心地宣布裁员的CEO。

12. 个体创业者扩张企业的速度,可能超过AI削减企业人员的速度

  • 与会者引用的数据称,初创公司同比增长10–15%,比上年同期季度高25%,美国新增初创企业数量是欧洲的6倍。会上还提到一种说法:过去50年的所有新增就业都来自初创企业和早期企业,因为大型公司在扩大产出的同时降低了劳动密集度。

  • Salim 对组织奇点的估计是,一家公司应当用过去所需人员的约20%运营,同时通过创造5至6倍数量的公司来抵消就业影响。Peter 将机制直接联系起来:70%能力的代码代理叠加裁员,会带来一场“个体创业者爆发”。

  • a16z 数据显示,AI单人创始人在一个季度内从1,500人翻倍至3,000人,而3年前几乎为零;非AI单人创始人数量则超过5,000人。Salim 的结构性解释是,大型公司越来越多地把精力用于协调工作,而非完成工作;“智能陨石”会把企业拆分为平台、生态系统和小团队。

  • Dave 修正了孤立创始人的形象:如今75%的成功企业都经过某种孵化器或加速器,而他刚开始投资时这一比例只有6%。另一位嘉宾给出的更大框架是,企业“工作”这一概念本身是工业时代的产物;AI赋能的自雇,可能让人重新获得能动性,也回到一种在历史上更常见的自我决定形式。

13. 教育必须从储备技能转向解决问题

  • Salim 将现有教育描述为供给侧生产:先把孩子深度训练成工程师、医生、律师或会计师,再去寻找需求。当没人知道5年后、甚至2年后的工作会是什么样时,这套体系就会失效;技能的半衰期也已经从约30年降至3年。

  • 他提出的替代模式从需求出发:先问学生想解决什么问题,再组合完成这一目标所需的技术、科技和技能。这一逆转足够激进,以至于他认为,很少有现有机构能在没有一批全新学校的情况下完成转型。

  • 一位嘉宾认为,堵点在招生激励机制。处于相关高中年龄段的学生,会围绕成绩、SAT、AP考试和简历信号,为进入“正确的”大学而优化,从而延续过时的课程体系,而有用的知识基础却在快速变化。对于那些无法想象创业的人,Peter 的回应克制却坚定:“请试试看。”

14. Starship把火箭当软件迭代,也把发射直播当产品战略

  • Starship V3的首飞同时采用了新飞船、Raptor 3发动机和新的德州发射场。Peter 引用的数据是,其将97,000磅载荷送入近地轨道,接近航天飞机载荷的2倍;每台发动机推力为250–280吨,比上一代高20%,总推力相当于约70架747起飞时的推力。

  • SpaceX 在着陆过程中损失了助推器,但 Peter 将其视为“造船—测试—失败—迭代”循环中的又一个数据点。这次任务已经部署了真正的 Starlink 原型,随后又释放了装有摄像头和灯光的“Doge Dots”;它们漂离释放器时回头拍摄 Starship。

  • Alex 认为,配套的 Starwatch 系统可能比连接能力更重要:部署在不同高度卫星上的摄像头可以观测地球、碎片及其他轨道物体,并共享这些数据。这次任务初步展示了将无处不在的观测能力嵌入通信星座的可能性。

  • 一位嘉宾总结了其中的创业启示:有意设计能够承受发射和加热过程的摄像头。Musk 理解“建立士气和培养追随者的价值”;通过 YouTube 和 X 直接分发内容,让CEO成为使命的传播载体,既靠执行力,也靠表演性来吸引人才和资本。

15. Musk整合与月球基础设施指向一体化太空—AI栈

  • Kalshi 对1年内 Tesla–SpaceX 合并的定价为50/50;Peter 则给出100%的概率。他设想合并后的实体初始估值为4万亿美元,可能成为第一家10万亿美元公司,并可能在5年内达到100万亿美元,同时明确披露自己投资了SpaceX和xAI。

  • 治理结构提供了实现机制。讨论称,Musk 通过10比1投票权股份控制SpaceX约85–86%的投票权,而他在 Tesla 的一票一权股票中持股约20%。如果由SpaceX发起收购,按双方相对估值不同,他可能获得合并实体60–80%的投票权。约束条件在于 Tesla 股东投票,以及SpaceX需要足够高的估值。

  • Alex 补充称,Tesla 估值降低可能让收购更容易被接受——“不构成投资建议”。共享GPU、IP、Optimus机器人以及月球或火星任务,已经构成技术层面的合并基础。他提出的 Magna MOBSTA 缩写,列出了最核心的一圈公司:Microsoft、Amazon、Google、NVIDIA、Apple、Meta、OpenAI、Broadcom、SpaceX、Tesla 和 Anthropic。

  • 物理网络正在与企业网络同步扩张。Peter 描述了 Chun Wang 领导的一项为期2年的私人火星飞掠任务;据称 Chun Wang 控制了11%的Bitcoin算力,并曾指挥 Fram2。Alex 提出的 Starlink 月球架构,将通过并行激光链路连接LEO、月球轨道以及可能的L1/L2,最终把这张网络延伸至火星。

  • Peter 将富裕的早期参与者视为推动太空民主化的融资来源:Soyuz舱位价格从2,000万美元涨至7,500万美元,而 Starship 凭借1,000立方米空间和规模效应,可能把轨道飞行价格重新拉回约2,000万美元。他关于电动绞盘和加速度的计算是:在每千瓦时7美分的电价下,将一名100公斤的乘客及其宇航服送上去只需200美元;Musk 早期设定的火星往返目标是50万美元。

  • Jared Isaacman 被引用的预测认为,太空人可能在2027年执行下一次载人月球飞掠,随后美国将在2028年转向月球南极。永久阴影陨石坑中的水冰,以及附近的“永恒光峰”,使月球南极成为战略目的地;Peter 预计自己的支付能力与月球通行权将在2035年前后交汇。