AI 专家回应:Elon 的 Grok 4 如今登顶 AI——这将改变一切,与 Emad、Salim 和 Dave 对谈 #182
摘要
Grok 4 已将学术基准推近饱和,竞争焦点正从原始智能转向可用的自主执行能力。 它在 AIME 2025 上拿到 100%,Grok 4 Heavy 在 Humanity’s Last Exam 上达到 44.4%,高于 Gemini 2.5 的 26.9% 和 o3 的 21%。Emad Mostaque 的关键区分是:模型“在推理,但还不会规划”——规划、记忆和智能体整合将成为下一阶段的瓶颈。
xAI 的领先既是模型故事,也是基础设施与执行力故事。 公司成立仅 28 个月,就在 Elon Musk 实现运营 100,000 块 H100 这一看似不可能的承诺后,扩张到据称 340,000 块 GPU;嘉宾估算已部署硬件价值接近 100亿美元,并称 xAI 的目标是 100万块 GPU。Dave Blundin 回忆,专家曾说这种规模不可能保持系统一致性,随后只能感叹:“天哪,他真做到了。”
训练成本结构已经反转,围绕合成、结构化推理数据的新飞轮正在形成。 Mostaque 表示,后训练过去只占算力消耗约 1%,DeepSeek 时升至 10%,如今已大致与预训练持平,部分原因是前沿模型能够为下一代模型生成数据。但这并不保证 Grok 会“更理智”——模式坍塌仍可能发生;Peter Diamandis 则表示,模型竞争正从纯粹堆算力转向“工程与质量挑战”。
即使高端智能可能在高价值工作流中卖出更高价格,推理成本也正在快速商品化。 Grok 4 的报价为每100万输入token 3美元、每100万输出token 15美元;Mostaque 估算,“100万个非常好的词”成本约20美元,并预计同等智能的成本每年可下降 5–10 倍,最终可能降至每100万词 1美元。Diamandis 认为,能够压缩工程时间的边际能力提升,仍会让开发者支付显著更高的价格;Mostaque 则怀疑 300美元的 SuperGrok Heavy 套餐是为转化企业客户而设的亏损引流产品。
企业价值初期将来自增强能力、降低错误率和吸收数据,而不是立刻全面替代人类。 Emad 表示,Arc Institute 正在数百万份实验日志和 CRISPR 工作流上测试 Grok 4;Peter 引用了大致的医学研究结果:单独使用 AI 的表现超过医生,也超过医生加 AI 的组合。Mostaque 仍强调,受责任风险限制,全面替代“还远得很”;Salim Ismail 则强调,AI 能处理人类无法整合的扫描和传感器数据。
编码、游戏和视频暴露出同一个机会:生成能力先到位,规划、反馈和分发仍未解决。 xAI 展示了一款 4 小时生成的第一人称游戏,并称专用编码模型将在数周内推出;发布演讲者预计,第一款真正优秀的 AI 游戏和第一部值得观看的 AI 电影将在明年出现,而今年可能就会有半小时可看的 AI 电视内容。Mostaque 对在位企业的警告是:更低的制作成本对公司有利,但“对行业里的从业者来说,这很糟糕”。
如果前沿模型最终收敛到同一个能力平台,持久瓶颈就会转向接口、智能体、芯片获取和分发。 Mostaque 预计 Grok 5 将协调 60 到 6,000 个智能体,调用专业工具,表现得像一个“把事情办成、而且不睡觉”的远程员工。嘉宾讨论了 Google 约 300万块芯片、xAI 和 Meta 的百万芯片目标,以及整个行业的供应约束;Liquid AI 等高效边缘模型则可能提供日常智能层。
精读
1. Grok 4 能以研究生水平推理,但仍不会规划
发布视频将 Grok 4 描述为在学术问题上“所有学科都超过博士水平,没有例外”,但同时提醒,它可能缺乏常识,也尚未发明新技术或发现新物理。发布演讲者认为发明能力可能会在今年晚些时候出现,并表示如果明年还没有出现,他会“感到震惊”。
Blundin 称这是类似钢铁侠 JARVIS 的“黄金时刻”:助手可以造出战甲,但人类仍必须决定“你要如何拯救世界”。它能解决极其困难的问题,却不会独立判断应该造什么,以及为什么要造。
Mostaque 进一步明确了这一限制:“我认为它在推理,但目前还不会规划。”他将下一轮模型规模与约 1 ronnaFLOP、即 10²⁷ FLOPs 联系起来,并表示模型能力应继续在算力与数据的共同推动下提升。
Diamandis 问道,在所有学科都具备研究生水平的能力,是否已经足以称为 AGI,并表示:“我们已经在毫无察觉的情况下通过了图灵测试。我们会不会也在毫无察觉的情况下通过 AGI?”Mostaque 回应称,社会会迅速适应强大工具,但完整的智能体能力仍需要更多基础模块。
2. 基准测试趋于饱和,前沿从回答问题转向发现问题
AIME 2025 给出了最清晰的信号:Grok 4 得分 100%。Diamandis 感叹:“你真的快把基准测试做完了。”但他同时指出,算力、数据和算法仍在进步,质量正越来越成为差异化因素。
Humanity’s Last Exam 包含 2,700 道题,覆盖领域极广;据估计,最优秀的人类在自己理解的领域内大约能拿到 5%,最高或许也只有 10%。Mostaque 举例说:“计算 Lie 群 G₂ 的分类空间的约化 12 维自旋配边。”这个例子说明,没有任何个人能与模型的知识广度匹敌。Blundin 还给出了一个来自五维引力理论的例子。
已发布的对比结果是:o3 得分 21%,Grok 4 为 25.4%,Gemini 2.5 为 26.9%,Grok 4 Heavy 为 44.4%。当被问及何时能达到 100% 时,Mostaque 回答“最多两年”,很可能就在明年。Diamandis 对测量问题感到不安:AI 可能很快就会提出并回答人类无法理解的问题,人类将无法判断它究竟在以多快的速度进步。
嘉宾对未来的最大猜想是新科学。Mostaque 提到,模型可能从数学推进到物理、化学和生物学,并称如果今年或最迟明年年底出现新物理学发现,他不会感到意外。Blundin 转述了 Alex Wissner-Gross 的猜想:解决量子隐形传态相关问题,或许能揭示宇宙中的其他智能;这只是推测,并非 Grok 4 已被证明具备的能力。
3. xAI 将极端规模转化为工程优势
Diamandis 提到 xAI 成立于 2023 年 3 月,并称公司在 28 个月内成为第一名模型。他回忆,Musk 曾承诺在当年夏末前部署 100,000 块 H100,当时听众都说“不可能”——但他最终做到了。
据称目前的集群包含 340,000 块 GPU,每块成本约 30,000 美元或更高,粗略计算价值约 100亿美元。Diamandis 还表示,xAI 计划在年底前部署 100万块 GPU。嘉宾将这一需求与每天约 10亿美元流入 AI,以及 Jensen Huang 预计到 2030 年行业年投资达 1万亿美元联系起来。
Blundin 描述了这场技术突围:专家认为如此庞大的集群不可能维持“幂律和一致性”。Musk 回到第一性原理,重新设计芯片连接,并让系统真正运行起来,最终引发行业感叹:“天哪,他真做到了。”
Mostaque 回忆,2022 年 Amazon 为他的团队搭建了一套 4,000 块 A100 的系统,当时是公开超算中速度第十快的系统;随着规模扩张,数百块芯片被烧毁。如今,硬件扩张和模型扩张都已经变成可以直接攻克的工程问题。
4. 后训练如今与预训练同等重要
Mostaque 将早期预训练描述为把互联网快照扔进“巨型超级计算机搅拌机”,产出的模型像“没喝咖啡、衣冠不整的研究生”。随后进行的强化学习清理只消耗约 1% 的算力;DeepSeek 将这一比例推高到 10%,而 Grok 4 的发布演示称,后训练投入如今已与预训练持平。
其运作机制是数据飞轮:前沿模型生成结构化推理轨迹和训练材料,供下一代模型使用,从而降低对无差别抓取互联网数据的依赖。Peter 的更广泛结论是,优秀模型之间的差异如今更多来自更好的数据、算法和工程质量,而不是简单地“把一切都扔进锅里”。
当被问及这是否会让 Grok 更理智时,Mostaque 诚实地回答:“但愿如此。”更多后训练并不会消除模式坍塌或潜空间故障,只是让模型获得了比原始 Reddit 数据和互联网规模数据更结构化的课程。
已公布的价格是每100万输入token 3美元、每100万输出token 15美元,并标注上下文长度为 56,000 token;API 讨论中则另行提到 256K 上下文。Blundin 提醒,许多宣传中的上下文窗口并不能完全使用,但如果大窗口确实可用,模型就能在一次处理中并行处理约 100 本书的信息。
5. 廉价智能与高价订阅可以共存
Mostaque 将 Grok 4 的成本与 Claude 4 Sonnet 和 o3 作比较,同时称 Grok 4 的表现优于两者。按每个token约 0.7 个词计算,他估算“100万个聪明的优质词”成本约为 20美元。
仅依靠 Vera Rubin 硬件,他预计明年推理成本就会下降 3–4 倍;再叠加算法进步,同等智能的成本每年可能下降 5–10 倍。他给出的终点是:“100万个惊艳的词,只要 1美元。”
Diamandis 认为,SuperGrok Heavy 每月 300美元仍可能对代码、机械设计及其他关键工作具有吸引力。如果边际能力提升能够节省昂贵的工程时间,或把错误答案变成正确答案,买家就可能接受再高 10 倍的价格,即使竞争产品正越来越商品化。
Mostaque 猜测,高级套餐正在亏钱,类似 OpenAI 此前对其 Pro 档位的描述。他将其视为面向企业的亏损引流产品:先解决“界面问题”,通过 Andrej Karpathy 所称的上下文工程把团队数据接入模型,再向企业销售;对企业而言,每位高级知识工作者每月 300美元微不足道。
6. 企业采用从研究和医疗增强开始
Mostaque 表示,Arc Institute 这家同属投资组合、也是领先的生物医学研究中心,已经在研究工作流中测试 Grok 4。模型可以筛过数百万份实验日志,并在“瞬间”选出有前景的假设,包括 CRISPR 研究。他补充说,xAI 的企业业务仅启动了 2 个月,Grok 将通过超大规模云厂商提供。
Mostaque 预计,医疗领域会先走“增强优先”路线:降低错误率、改善结果,最终才会替代专业人士。Diamandis 认为监管将是主要障碍,而 Mostaque 强调,全面替代所涉及的责任风险“还远得很”。
嘉宾引用了一项 Google 医疗 AI 研究的大致结果。Diamandis 描述称,医生单独诊断的准确率约为 80%,医生加 AI 的“半人马”组合接近 87%,AI 单独使用则在 90% 出头。Mostaque 记得医生单独使用的数字是 70%,并提到 Daniel Kraft 估计医生约 30% 的诊断是错误的。这些数字只是大致呈现,并非一个已经确定的单一结果。
Mostaque 强调,人类偏见也会影响输出。Ismail 更广泛的观点是,问题不只是击败一个医生:现有扫描和传感器已经产生了超出个人吸收能力的信息,而 AI 可以纳入那些“过去根本不可能进入诊断”的数据。
7. 生成式娱乐扩大供给,但注意力和分发仍然稀缺
发布视频展示了一款据称在 4 小时内完成的第一人称射击游戏。发布演讲者强调,核心游戏逻辑并不是唯一难点:获取纹理、文件和其他资产,过去一直是制作具有视觉说服力的作品时的约束。
发布演讲者预计,AI 将生成艺术内容,把它映射到 3D 模型上,并通过 Unreal 或 Unity 等引擎生成可执行文件,可能就在今年,最迟明年。时间判断是:明年出现一款真正优秀的 AI 电子游戏,今年出现半小时可看的电视内容,明年出现一部值得观看的 AI 电影。
Diamandis 预计娱乐内容会出现激进碎片化:游戏可能每 4 小时迭代一次,朋友们也许会观看同一部电影的个性化版本,并拥有不同结局。他预计互动媒体会比被动观看增长更快,包括能够直接回应观众的角色和声音。
Mostaque 反驳称,人类的注意力不会增长。他引用的数字是:游戏市场约 4,500亿美元,电影市场约 700亿美元;电子游戏市场已从约 1,700亿美元增长到 5,000亿美元,Metacritic 平均分则从 69% 升至 74%;电影行业增长幅度小得多,IMDb 平均评分约为 6.3。
Mostaque 认为,大众共享的头部故事仍会存在,因为“分发、分发、还是分发”依旧决定触达范围。更低的成本对公司有利,也能帮助个人创作者讲出更丰富的故事,但“对行业里的从业者来说,这很糟糕”。
8. 编码的下一层抽象是上下文,而不是更多手写代码
发布演讲者表示,xAI 最近训练了一个兼顾速度与智能的专用编码模型,预计将在“数周内”发布。Mostaque 称现有 Grok 模型已经能写出整洁代码,并预计专用模型会进一步提升。
Diamandis 重新提到 Mostaque 早先“5 年内不再需要程序员”的预测,这一说法曾招致印度用户的辱骂邮件。随后他问,顶尖程序员是否只是会因此写出多 100 倍的代码。Mostaque 回答称,下一种角色将是负责指挥系统的“真正优秀的上下文工程师”。
Mostaque 的逻辑是,代码之所以成为中间语言,是因为编译器无法理解人类意图的复杂性。他提到 Cursor 在一年内实现 5亿美元营收,Anthropic 的营收约为 40亿美元,其中可能约三分之二与代码相关。
剩下的弱点是编排。Diamandis 表示,模型已经能生成模块和仪表盘,有时甚至会提前想到他尚未考虑的需求,但创意项目仍需要规划、协调、多智能体系统,以及更紧密的 UI 反馈闭环。
9. Grok 5 的竞争将围绕智能体、世界模型和稀缺算力展开
发布演讲者表示,xAI 将在 3–4 周内开始用超过 100,000 块 GB200 训练视频模型。Mostaque 将其与团队首次训练的最先进视频模型作对比:当时使用了 700 块 H100;如今领先的视频项目通常使用约 2,000–4,000 块芯片。
Mostaque 称视频模型是“世界模型”:学习视觉变化的同时,也会学到物理规律的表征,从而支持 3D 资产、模拟世界和自动驾驶训练数据。他预计 xAI 的系统初期会是独立模型,但语言、图像和视频系统最终可能会合并为一个模型。
他设想的 Grok 5 是一个多智能体系统,拥有“60、600 或 6,000 个”工作者、一个世界模型、系统连接能力,以及调用 Maya、物理模拟器和 Lean 的能力。规模足够大后,它就会变成一个“极其多才多艺的工作人员”;人类与 Grok 5 或 Grok 6 的交互,可能看起来就像一次 Zoom 通话。
Mostaque 预计 Gemini 3、GPT-5 和 Grok 4 级别的系统将处于大致相同的智能平台上。差异化因素将变成一个类似远程同事的接口:给它发消息、交代任务,在它不确定时收到进度确认,并让它运行超过目前所称的 7 小时任务时长。他偏好的 AGI 定义是“真正有用的智能”(actually useful intelligence),能够“把事情办成,而且不睡觉”(just gets the job done and it doesn’t sleep)。
资本并不是首要约束。嘉宾提到 Google 约 300万块芯片、xAI 和 Meta 的百万芯片目标、OpenAI 的资本以及 Stargate 规模的基础设施,还有 Amazon Trainium 对 Anthropic 的支持。下一次跃迁将是 1,000万块芯片,而全世界据估计只有 2,000万块;因此获取、封装和供应能力将成为决定性因素。
Diamandis 注意到,Apple 尚未进入讨论。Blundin 表示,Apple 控制着 TSMC 约三分之一、用于其 M2 和 M3 产品线的制造产能,可能成为数据中心领域的重要玩家。Mostaque 认为,模型一旦足够好,就会开始像公用事业,因此高效边缘模型的重要性将持续上升。
Nvidia 仍是默认选择——“买 Nvidia 不会被解雇”(you don’t get fired getting Nvidia)——但买家会在任何能买到的地方采购有能力的芯片,因为虚拟工作人员的成本远低于人类团队。Diamandis 表示,Liquid AI 的边缘模型可以运行在 M3 级芯片和汽车硬件上,据称效率约为暴力运行 Transformer 的 100 倍;它们可能负责提供日常智能,而稀缺的前沿系统则处理“天才级”工作。