AI业内人士揭秘Elon Musk赢下AI的主计划:AWG与Dave Blundin对谈 | 第192期
摘要
xAI押注,前沿模型的领先是一场比拼物理规模的竞赛,而Elon Musk把第二名视为毫无价值。 嘉宾称,Colossus 2将在孟菲斯上线1吉瓦电力和500,000块NVIDIA Blackwell GPU,2026年翻倍至1 million块,并训练Grok 5;按每块Blackwell 30,000美元计算,仅芯片成本就约为300亿美元。Dave Blundin的表述直截了当:「你不会去建全球第二大的数据中心。要么赢下这场竞赛,要么就没赢。」
Grok Code Fast 1与其说是商品化定价,不如说是高度补贴的编程工作流圈地。 Diamandis援引的价格为每百万输入token 0.20美元、每百万输出token 1.50美元;GPT-5的输入价格为1.25美元,Claude Sonnet 4为3美元。Blundin否定了「逐底竞争」的说法,因为需求实际上没有上限,并将其比作「毒贩免费送出第一口」。分发渠道可能与基准性能同等重要:消费者是通过Cursor或Windsurf等编程环境接触模型,而不是直接打开浏览器。
横向AI模型正在抹平支撑应用软件长期发展的界面和功能护城河。 Google的Gemini 2.5 Flash Image,即Nano Banana,展示了每张图片3.9美分的价格、角色一致性、多图融合和基于语言的编辑能力;Google Translate如今也直接冲击语言学习市场,Duolingo股价据报下跌10%。Alexander Wissner-Gross将这一威胁概括为:「那个聊天机器人会吞掉你」,除非垂直SaaS公司把目标提高「100倍、1,000倍」。
实时多模态模型可能成为消费者与所有行业发生交易的单一接口。 OpenAI的GPT Realtime API现场展示了围绕824,000美元购房能力搜索Zillow;Diamandis则称,AI是一层被忽视的管理层,能够把摄像头和非结构化运营数据转化为排期、采购和纠偏动作。Wissner-Gross提出「流式交互模型」,让每一段语音、每张图像和每个界面都在需要时即时生成。
当前AI利润似乎集中在芯片和基础设施,但出口限制正在推动替代性技术栈。 NVIDIA被描述为一家4万亿美元公司,营收同比增长56%,自ChatGPT于2022年发布以来股价上涨700%;因此,Wissner-Gross更倾向于「金字塔」论,即价值集中在技术栈底部。不过,Cambricon、Huawei及其他中国架构可能削弱NVIDIA/CUDA的单一生态,尤其是100倍至1,000倍的软件增益,可能远远压过名义上的7纳米对2纳米劣势。
创纪录的AI资本开支和股权估值,要么是ASI时代的经济印记,要么就是暴力且短暂的重新定价温床。 节目提到,2025年AI基础设施支出为3750亿美元,2026年约为5000亿美元,Jensen Huang预计年度支出将达到6000亿美元,并贡献约一个百分点的GDP。纳斯达克市值相当于M2的176%、GDP的129%,Wissner-Gross于是追问,在超级智能到来前这一比例应升至何处;Diamandis回答「趋近于无穷」,Blundin表示认同,但Diamandis仍承认,恐慌可能引发大幅回撤。
具身AI是数据中心智能进入制造业、家庭和交通领域的路径。 Jetson AGX Thor被描述为提供2 petaflops的FP4算力,性能是Orin的10倍;中国人形机器人销量预计2025年超过10,000台,增长125%。Tesla的纯视觉训练、1X的车队学习以及Apple对供应商自动化的要求都支持同一判断:Diamandis称「每一份工作都在训练集中式版本」,而不自动化的制造商可能无法存活。
Health AI正在把诊断带入低成本、持续监测的环境,但节目讨论的长寿证据仍远未成熟。 嘉宾提到一款15秒完成检测的AI听诊器和一款AI引导的手持超声设备,随后讨论了一项小鼠psilocybin研究:存活率为80%对50%,细胞寿命最长延长57%。Diamandis还介绍了自己的干细胞「再教育」疗程和戏剧性的患者视频,但他个人的生物标志物结果仍需等待1、3、6和12个月的检测。
精读
1. 两到三年的超级智能时间表打破传统职业规划
Wissner-Gross给新生的建议是有条件的,并不是一刀切地要求退学:如果目标是创业,现在就开始、甚至离开学校,存在很强的激励。他的基本假设是,超级智能可能在「未来两到三年内」到来,使得沿用20或30年前形成的职业预测变得不可靠。
Diamandis给出了更持久的指南:找到一个真正让你投入的问题,然后持续把最新的智能应用到这个问题上。技术会不断变化,但创始人的「为什么」可以延续;他的建议是暂时停下传统意义上的进阶,先找到驱动力。
MIT新增的6E创业方向,构成了「课程已经无关紧要」这一说法的制度性反例:学生可以在创业公司或风险基金里度过数个学期,学习企业如何运作。Wissner-Gross表示,他会在该项目中教授高级算法,体现出正式学习与立即执行创业之间的混合模式。
2. Colossus把惨痛教训转化为基础设施战略
Colossus 2的既定计划,是在孟菲斯建设一座1吉瓦设施,配置500,000块NVIDIA Blackwell GPU,2026年再翻倍至1 million块,并成为Grok 5的诞生地。Diamandis强调,Colossus 1尽管被认为不可能完成,仍在122天内从零建成。
Wissner-Gross称这是「应用于硬件扩张的惨痛教训」。他总结Richard Sutton的教训是:数十年来围绕视觉、语言和语音打造的「手工解决方案」,最终都被结合海量数据与算力的通用算法碾过;即使曾经引发新闻轰动的猫咪检测器,后来也变成了平凡的涌现能力。
Blundin把Colossus和OpenAI的Stargate描述成一场赢家通吃的竞速:训练好的模型可以编译成速度快、易于定制的系统,但客户不会明知故犯地从第二或第三名模型开始。Musk、Sam Altman及其资本提供方因此都是「All in」。
训练与推理不能混为一谈。Wissner-Gross把训练比作开发或编译时间,把推理比作执行:前沿训练仍相对集中在美国,而全球文明正在印度、中东、挪威等地铺设推理能力。
3. 决定谁能训练前沿模型的,不只是GPU,还有电力和资本
Diamandis将Musk的融资渠道描述为「基本上无限的资本」,家族办公室和主权财富基金都准备超额认购他的融资轮。按照Blundin估算的每块Blackwell 30,000美元计算,1 million块芯片在机架、网络、冷却、建设和电力之外,就已经代表300亿美元。
据介绍,Colossus 1使用现场天然气热电联产,而不是实质性依赖电网。Wissner-Gross预计将出现一种「口袋经济」:数据中心与核电站、燃气发电或其他可靠能源共址,因为公用事业和审批速度无法及时扩张。
数据中心开发商Jeff Markley据称在发现5兆瓦发电机已经售罄后,买下了所有可获得的3兆瓦发电机。这个发电机轶事把第二个瓶颈具体化了:即便拥有燃料或电网供应,如果设备无法将其转化为可用电力,也仍然不够。
因此,Diamandis把投资问题转向发电和电力基础设施,并回忆Eric Schmidt的说法:AI受限于「能源」,而不是芯片或智能。嘉宾提出,未来一期节目可以研究Leopold披露的持仓,但本期没有给出完整的交易判断。
4. Grok Code Fast 1用价格和工作流分发抢占需求
Diamandis援引Grok Code Fast 1的价格:每百万输入token 0.20美元、每百万输出token 1.50美元。与GPT-5输入1.25美元、Claude Sonnet 4输入3美元相比,他在节目展示的比较中将其描述为输入端便宜约15倍、输出端便宜10倍。
Blundin否定了最直观的结论:「这绝对不是逐底竞争,尽管看起来像是。」他的逻辑是,低价初始接入能够培养使用习惯、刺激实际上无限的需求,而用户很快就会希望获得无限供应的这种能力。
Wissner-Gross强调了一个不同寻常的分发选择:消费者不能简单地在浏览器中打开Grok Code Fast 1,而必须在Cursor或Windsurf等环境中找到它。编程工具因此正在成为智能的入口,并可能与浏览器争夺对用户的战略控制权。
经济账仍未厘清。Diamandis质疑这样的价格如何覆盖底层FLOPs,并称数十亿美元的亏损不可能无限期持续。Wissner-Gross的回答是,各家实验室采用不同的核算方式,路由优化也可能降低成本;但Jevons悖论仍可能意味着,随着生成代码接近零边际成本,总支出反而上升。
5. 使命、股权和冲刺速度构成Musk的招聘体系
嘉宾将xAI招募14名Meta工程师解读为使命与股权的组合,而不是单纯的现金竞价。Diamandis认为,建设者会被带有「纯粹信号」的使命吸引,而Musk此前创办的公司则让候选人相信,这份努力能够转化为有价值的股权。
这与Meta新超级智能业务有研究人员离职的报道形成对比,其中包括拿到9位数薪酬包、后来回到OpenAI的人。主持人反复承认,他们不了解Meta内部的事实;他们较窄的推断是,单靠金钱可能无法捕获一名候选人的「时间、注意力和心」。
Wissner-Gross欢迎这种竞争,认为它证明AI不会陷入由一家实验室掌控未来的「单一文化」。多个前沿实验室可以代表不同文化,包括xAI的「疯狂专注与高强度」;人类受益于这些文化相互竞争,而不是其中一家获得永久霸权。
Musk的「可持续丰裕」愿景,将充足的能源和材料与充足的智能和自主性结合起来。Blundin把这种长期丰裕与短期、9-9-7式执行冲刺并置;Wissner-Gross指出,中国的说法是996,而且人们正在反抗这种文化。一座延迟一年完成的million-GPU数据中心可能毫无价值,但Diamandis和Wissner-Gross都强调,7天工作并不是可持续的生活方式,也未必是人类永久需要承担的要求。
6. Nano Banana用语言取代界面专业知识,并暗示世界模型
Google的Gemini 2.5 Flash Image,即昵称为Nano Banana的模型,被介绍为速度快、API价格为每张图片3.9美分。其突出能力是一致性:能够在编辑过程中保持人物、宠物和物体的一致,融合最多13张输入图片,并根据选定的地图位置生成合理的视角。
直接冲击来自基于界面的专业知识。Diamandis将其概括为「用语言编辑,而不是用图层编辑」:用户不再需要多年熟悉蒙版、菜单和专有控件,从而消除了帮助Photoshop和Canva留住订阅用户的转换成本。
Blundin把这一转变比作从命令行到图形界面的迁移,但预计这次跃迁会更大:软件将直接执行口头请求。他80多岁的母亲从未掌握Photoshop,却可以通过对话创建图像,体现了能力民主化和既有界面衰退。
Wissner-Gross认为「Photoshop杀手」低估了这项进展。要求Nano Banana从另一个角度展示同一场景,意味着它内部可能存在超越像素编辑的表示;他将其解读为一个可能来自「更庞大得多的模型的触手」,预示着世界模型将并入Gemini级系统。
7. 合成媒体让视觉信任成为明确的技术选择
Diamandis担心的不只是更强的编辑能力,还有加速扩散的虚假信息和视觉信任的瓦解。他如今看到新视频的默认反应已经是「这是真的吗?」,并预计很多人的第二反应会变成「不,这不是真的」,旧有的「眼见为实」假设将因此终结。Blundin将结果概括为「工业规模的deepfake」。
Wissner-Gross提出一条从摄像头经过浏览器的加密链路,用来证明图像未经修改,类似于安全的在线支付。他立即对这一设想加以限定:他的基准预期是,仅限经过验证的媒体不会流行到足以恢复普遍信任。
Google的SynthID水印意味着生成器与检测器之间的军备竞赛仍在继续,但作者身份在概念上仍未解决:如果一个人描述月球场景、软件负责渲染,那么作者是提示词输入者还是模型?嘉宾将所有权和人在回路中的创作留作开放问题。
Wissner-Gross还反驳了「道德恐慌」的说法。一旦智能眼镜把实时增强叠加层铺到日常视野中,「一切默认都会被照片编辑」;与科学进步和现实持续合成化的更大转变相比,他预计今天的焦虑最终会显得幼稚。
8. 翻译展示通用模型如何蚕食垂直SaaS
据称,Google Translate每月为600 million用户处理约1万亿个单词,覆盖243种语言,即58,806个语言对。Gemini 2.5加入低延迟对话翻译,把transformer重新带回其最初开发的机器翻译应用——也就是编码器—解码器架构所针对的领域。
Wissner-Gross提出了一个二阶问题:普遍互操作性可能保护低资源语言,而不是终结它们。如果说话者不再需要趋同于英语才能交流,AI可能促进语言多样性,而不是加速向一种主导语言坍缩。
市场警告来自相邻产品。Blundin提到,Chegg在ChatGPT提供更好的作业作弊方式后,股价从约90美元跌至1.40美元,但Diamandis指出,作弊并不是Chegg真正做的事情。Google的语言练习模式则被指与Duolingo在8月29日股价下跌10%有关。Duolingo被描述为一家拥有130 million活跃用户、规模130亿美元的企业,其中只有10%付费。
更广泛的判断是生死攸关的:每个SaaS产品都有可能变成通用模型中的一个用例。存量用户和监管可以争取时间,但Wissner-Gross敦促受威胁的公司「把目标提高100倍、1,000倍」——对Duolingo而言,或许意味着转向能够在一分钟内加载一门语言的脑机接口。
9. 实时模型同时成为界面和运营经理
OpenAI的演示中,Zillow助手使用824,000美元的购房能力,找到一处能够看到天际线和Mount Rainier景色的Wallingford房产,并提出安排看房。Diamandis希望的终点不是另一个搜索框,而是一个能够找房、买房、融资、安排搬家公司,并告知用户何时到达的智能体。
Wissner-Gross将GPT Realtime描述为低延迟Advanced Voice Mode的API版本,适用于第三方客服及其他应用。他提出的类别「流式交互模型」,即streaming interactive models或SIMs,不仅覆盖语音,也延伸到持续按需生成的界面、图像、模拟世界,甚至脑机输入。
Diamandis强调的是管理,而不是炫技。摄像头已经产生海量非结构化数据;智能可以把这些数据转化为决策、排期和干预措施,例如及时发现建筑工人把Tyvek的搭接方向装反,避免雨水被导入墙体、最终导致结构腐烂。
Blundin给出的运营案例是Link Studio旗下的语音客服公司Vocara:此前一周经常性收入已经翻倍,并计划在年底前增长10倍。他表示,消费者更喜欢它而不是人工呼叫中心,尤其是在多模态能力允许智能体在对话中创建图像、调取数千个示例之后。
10. 基础设施攫取当下利润,国家级技术栈开始增多
NVIDIA被描述为顶住泡沫担忧,营收同比增长56%,估值达到4万亿美元,自ChatGPT于2022年发布以来股价上涨700%。节目还称,NVIDIA已将中国销售额的15%交给美国,以维持出口渠道。
Wissner-Gross对比了两种金字塔:正常金字塔中,利润集中在芯片、制造和数据中心;倒置金字塔中,应用捕获价值,模型变成商品。当前NVIDIA和中国对芯片的热情让他更倾向于前一种判断:租金仍在技术栈底部附近聚集。
Cambricon和Huawei则显示出后NVIDIA、后CUDA单一生态的雏形。Diamandis对出口限制的反驳是因果性的:拒绝向中国提供产品,会迫使其发展国产替代品,正如早期对卫星的限制一样;他补充称,100倍至1,000倍的算法增益,可能远比7纳米对2纳米的制造差距重要。
印度提供了另一条多元化路径。Diamandis预计Mukesh Ambani的Reliance Intelligence会复制Jio在2016年的打法——免费语音、极低价数据、快速激活和全国4G跃迁;Wissner-Gross则强调,印度拥有异常庞大的20至40岁人才池,AI有可能绕过制度摩擦直接触达民众。Blundin补充说,糟糕的交通条件可能创造空中配送机会。
11. AI先通过界面和起草进入政府,再进入选举权力
Airbnb联合创始人Joe Gebbia出任美国首席设计官,被描述为一次务实的创业者介入:让政府服务「用起来像Apple Store一样令人满意」。Wissner-Gross认为,开源的美国Web Design System是改善多个联邦网站共用组件的高杠杆切入点。
Cloudflare的Matthew Prince登上TIME AI榜单第一,引出了另一个治理问题:自主智能体是否应当拥有与人类相同的网站访问权。Diamandis的解释是,出版商看重Prince保护署名权和互联网内容经济、避免模型不加区分抓取的努力。
对于让AI掌权,Blundin预计AI会起草法律,因为立法机构无法匹配新问题出现的数量和速度,但他预测人类政治人物仍会把自己的名字署上去。Diamandis希望提高机器能力,却怀疑根深蒂固的官僚机构和法院会允许这种变化;腐败可能只是转移到控制系统的工程师、公司或州。
Wissner-Gross称这一前提「毫无意义」。他的第三种立场是,人类和AI将融合,甚至可能发生物种分化,问题最终变成:人们是否会选举人类?答案仍然是会,但届时人类在生物和计算层面已经耦合,不再是泾渭分明的两类主体。
12. ASI预期让传统泡沫比较变得不完整
节目援引Jensen Huang的预期:AI年度支出将达到6000亿美元;基础设施投资2025年达到3750亿美元,2026年约为5000亿美元;整个建设周期将为美国GDP增加约一个百分点。来自硅谷、主权基金和家族办公室的资本,正通过AI建设流入实体经济。
令人警惕的比较是,纳斯达克市值相当于美国货币供应量的176%、GDP的129%,均高于互联网泡沫峰值。Blundin提醒,纳斯达克如今占经济的比重更大,是因为科技本身变得更大;如果看更广泛市场的市盈率,极端程度并不像图表显示的那么高。
Wissner-Gross的思想实验,是节目对泡沫叙事最直接的挑战:在人工超级智能到来前夕,纳斯达克对M2的比例应该达到多少?Diamandis回答「趋近于无穷」,Blundin表示认同;Wissner-Gross预计,租金会暂时集中在上市基础设施提供商手中,随后随着智能驱动的利润扩散到整个经济,可能趋于平台期。
Diamandis仍承认,恐慌可能造成严重的市场下跌。他对互联网泡沫的类比是:互联网是真实存在的,但Amazon股价仍然下跌超过90%,随后9/11发生,在他看来反而构成一次绝佳买入机会。技术有效性并不能消除估值波动或择时风险。
13. AI离开数据中心,进入医疗、机器人和自主移动
在医疗领域,嘉宾重点介绍了一款英国AI听诊器:15秒内检测重大心脏疾病;还介绍了Exo的手持超声设备,它会告诉用户探头应向哪里移动或旋转,然后再解读图像。Diamandis预计,持续运行的家庭、可穿戴设备和马桶传感器,将推动保险公司从报销疾病转向为预防融资。
长寿部分明确更具实验性。一项2025年的小鼠研究据称将细胞寿命延长最多57%;从约第20周开始给老鼠用药,28周后存活率达到80%,而对照组为50%。Wissner-Gross称,论文使用的是psilocin,并希望未来能够将其与中枢神经系统致幻效应分离的端粒相关益处提取出来。
Diamandis还介绍了自己的疗程:循环约12升血液,提取约300 cc免疫细胞,与脐带血干细胞共同孵育一夜,再回输12.7亿个「再教育」细胞。他展示了1型糖尿病和ALS患者的戏剧性视频,并作出强有力的治疗性判断,但他自己的证据仍属于未来时点:生物标志物将在1、3、6和12个月检测。
NVIDIA的Jetson AGX Thor是连接具身智能的桥梁:提供2 petaflops FP4算力,约为一块Blackwell的十分之一,或30部iPhone 16 Pro,性能是Orin的10倍。中国人形机器人销量预计2025年超过10,000台,增长125%;更长期的预测是,到2040年将有10 billion台人形机器人。
14. 车队学习把人类活动转化为机器人训练基础设施
Tesla的Optimus战略被描述为从动作捕捉服转向仅凭工人视频进行视觉学习,这与Musk在自动驾驶中拒绝使用激光雷达的立场相呼应。Wissner-Gross称,数十亿名智能眼镜佩戴者将为机器人提供「最惨痛的教训」:被动采集的视频可以训练覆盖几乎所有手工行业的模型。
Diamandis表示,在1X,前约10,000台机器人的车队学习是强制性的:家庭遥测数据流向中央系统,用户无法退出。其回报是集体记忆——如果一台机器人打翻咖啡杯,其他9,999台都能学会不再重复,因为「每一份工作都在训练集中式版本」。
据称,Apple要求一级供应商在可能的地方实现自动化,以提高一致性并降低成本。Wissner-Gross将这一逻辑延伸到主权供应链:足够的机器人推理能力,可能让各国把此前依赖低价海外人力的制造环节带回国内。
Waymo的规模仍落后于Uber:每月700,000次行程,对比Uber每天30 million次;但据称,单辆Waymo每天完成的行程已经超过99%的Uber司机,因为它几乎可以持续运营。Diamandis预测,自主出行将比拥有汽车便宜4倍,进而重塑出行、停车以及人们能够负担居住的地点。
15. 今天的电力冲击可能包含明天的效率过剩
在数据中心需求讨论中,美国消费者电价被展示为自2021年以来持续上涨。短期应对方式是让更多发电能力与算力共址,但Wissner-Gross警告,如果递归自我改进带来又一次类似DeepSeek的算法冲击,不能简单地把直线趋势外推下去。
Diamandis将人脑约20瓦的功耗,与他估计的前沿模型所需的高出100,000至1 million倍的能源进行对比。因此,更好的芯片和算法可能带来10^5–10^6级别的效率提升,让同一套已安装能源基础转化出数量级更高的智能。
Wissner-Gross把理论上限推得更高:人脑并不是最优计算机,可逆计算也可能突破传统Landauer极限假设。因此,节目最后的能源判断具有双重面向——电力是眼下的瓶颈,但智能最终可能足够快地重新设计计算,从而逆转当前看似稀缺的局面。