先锋 趋势 方法 投研 作者
DeepSeek 对决 Open AI——Emad Mostaque 与 Salim Ismail 谈 AI 现状 | EP #146
返回节目精读

DeepSeek 对决 Open AI——Emad Mostaque 与 Salim Ismail 谈 AI 现状 | EP #146

摘要

  • DeepSeek 引发市场震动,靠的是可见的推理过程、开放源码、基准测试持平和极低价格的汇聚,而不是某个出人意料的研究突破。 Emad Mostaque 在前一年2月就称其为最看好的 AI 公司之一;V3 在12月追平 GPT-4o,随后 R1 展示了 OpenAI 的 o1 所隐藏的推理过程。模型因此像“屏幕另一端的另一个人”,而更小版本还能在笔记本电脑上运行,叙事迅速扩散到技术圈之外。

  • 成本曲线正在挑战前沿模型的资本开支假设,但未必会压缩 AI 总需求。 Mostaque 称 DeepSeek 比 o1 便宜96%,V3 公布的训练成本约为600万美元,而 R1 所演化自的原始模型可能只花了20万美元;相比之下,OpenAI 前一年训练模型的支出估计为30亿美元。但他认为,DeepSeek 会通过提前释放“便宜到无法计量的大众智能”来抬高在位者估值;Peter 则以 Jevons 悖论解释,更便宜的单位成本可能加速消费。

  • 美国芯片限制似乎促成了中国效率优势,而不是阻止竞争性模型出现。 DeepSeek 在公布的训练中使用了约2000块带宽受限的 H800,编写底层 PTX 代码,通过稀疏模型扩展内存、改进数据,并对系统进行密集工程优化。Mostaque 将 DeepSeek、BYD 和 Xiaomi 视为中国工程能力的代表;Diamandis 则把制裁定义为“用更少做更多”的进化压力。

  • 短期冲击首先落在远程知识工作,实体自动化紧随其后。 Mostaque 对2025年的判断是绝对的:“屏幕另一端能做的任何事”,都可能以几分钱的成本做得更好;他点名 BPO、编程、客服、设计、税务和媒体流程。Peter Diamandis 提到 Salesforce 减少工程师招聘并报告生产率提升30%,而 Salim Ismail 预计会经历两个阶段:先是大规模岗位替代,随后是顶尖员工借助 AI 产出远超从前。

  • AGI 竞赛没有共识性的安全刹车,而更便宜的开放模型正在削弱以算力为基础的控制策略。 Mostaque 称主要 AI 领袖预计 AGI 会在3到5年内出现,Sam Altman 的判断更早;他描述的演进路径是从可靠的“厨师”,到远程同事和智能体团队,再到能够发明创造的“超级厨师”或 ASI。Ismail 认为精灵已经出瓶;Mostaque 的缓解方案是,“唯一能阻止坏 AI 的,是好 AI”,而且这种好 AI 必须作为具有韧性的公共基础设施广泛可得。

  • 廉价智能打破的不只是就业,还包括货币政策传导、组织结构和由工作产生的意义。 Mostaque 认为,如果新增需求主要购买 GPU 和机器人,美联储的通胀—就业双重使命可能在5年内失效。他提出的核心问题——“当资本不再需要劳动时,劳动如何获得资本?”——指向剧烈的通胀与通缩周期,以及人的能动性危机,而不只是生产率繁荣。

  • Mostaque 提出的答案是 Universal Basic AI:开放数据、模型和专业系统,让人们拥有并扩展智能。 Intelligent Internet 可以利用算力支持机构级数字货币,同时让人们凭借个人和知识参与,再为癌症、自闭症、教育、政府及其他受监管领域建设开放技术栈。可投资的含义不是再押注一个专有 API,而是押注基础设施:当智能商品化,可信数据、协调能力、本地化和人的能动性将成为差异化所在。

精读

1. DeepSeek 的震动,是建立在持续一年可见进展上的产品时刻

  • Mostaque 并不认为 R1 是凭空出现的奇迹:他在前一年2月就称 DeepSeek 是最看好的公司之一,夏季前后看到 DeepSeek Coder 登上编程排名榜首,随后又看到 V3 在12月追平 GPT-4o。剩下的问题只是它能否复现 o1 式推理;“结果你猜怎么着,它做到了。”

  • 12月的基础模型已经证明,模型可以用低得多的成本训练出来,但 R1 可见的思维链把工程成果变成了用户体验。OpenAI 的 o1 说自己在思考,然后返回答案;R1 则展示它如何拆解问题,让人感觉“屏幕另一端有另一个人”。

  • 开放性补上了最后一环。人们下载更小的蒸馏版本,在笔记本电脑上运行,同时分享性能结果;Mostaque 认为,即便基准测试完全相同,一个封闭模型也不会引发同样的连锁反应。这个突破来得快、看得懂,也用得上。

  • Ismail 将其在就职日发布解读为地缘政治上的挑衅,但认为其经济学符合指数级去货币化:如果能力端超预期,成本端也应低于预期。Diamandis 的视角更宽——继 ChatGPT 用5天达到100万用户、2个月达到1亿用户之后,一次次采用率冲击会成为“新常态”。

2. 约束迫使 DeepSeek 用工程能力替代蛮力算力

  • Mostaque 给出的 headline 对比是,DeepSeek 比 o1 便宜96%。他称 V3 公布的训练成本约为600万美元,并估计 R1 所演化自的原始模型训练成本可能只有约20万美元;与此同时,他回忆 OpenAI 前一年训练模型的支出约为30亿美元。真正冲击市场的,是数量级差异,而不仅是基准测试持平。

  • DeepSeek 说自己在这次训练中使用了约2000块 H800,并不是说它只拥有2000块芯片;Mostaque 猜测其总算力集群可能接近1万块,仍与许多硅谷初创公司相当。他不接受“未披露库存”足以推翻这套运行经济学的说法,称真正做过这类模型的人都知道,这些数字是对得上的。

  • H800 受限的互联带宽推动了底层优化。Mostaque 将其与 Stability AI 的带宽受限超级计算机相提并论:工程师通过在 CUDA 之下编写 PTX,仍然做出了全球最好的模型之一。DeepSeek 同样“把它彻底工程化”,强化了他的判断:随着 AI 从研究转向流程工程,中国的优势会逐渐显现。

  • DeepSeek 没有只依赖更快的并行算力扩展,而是通过稀疏架构扩展内存:Mostaque 描述的模型约有6400亿参数,但每次只有约300亿参数处于激活状态。更好的数据同样关键——模型使用约14万亿个词训练,推理能力转换则使用了合成数据。“模型就是数据”,真正的突破团队会检查流程的每个环节,而不是用规模掩盖糟糕输入。

3. 蒸馏指控无法解释掉 R1 的方法论

  • David Sacks 提出,DeepSeek 使用了蒸馏:学生模型可以向 OpenAI 查询数百万次,模仿教师模型的推理。Mostaque 的第一反应是,“有点像在说水壶笑茶壶黑”,因为前沿实验室本身也在使用互联网上产生的数据训练模型。

  • Mostaque 称 o1 的输出处于前沿,但缺少思维链推理。他认为真正需要优化的是 R1 以及 Google Gemini Flash Thinking 模型展示的推理轨迹,而不是声称 R1 是有意复制 OpenAI。

  • 他称论文中的 R1.0 版本能够自行生成数据,并将其与 AlphaGo、AlphaZero 和 MuZero 联系起来——这些强化学习系统都曾在围棋上击败人类。他没有声称 R1 完全隔绝于外部信息:OpenAI 的输出必然会出现在互联网规模的训练语料某处,模型吸收这类材料后有时也会自称 OpenAI。但他区分了偶然包含与蓄意窃取。

4. 更低的推理成本可能扩大 NVIDIA 市场,同时重置硬件假设

  • Ismail 认为 NVIDIA 的芯片估值过高,但不相信抛售反映了终端需求:AI 消费正在爆炸式增长。Mostaque 指出,NVIDIA 在前一年仍上涨约100%,并把可服务市场定义为“替代全部知识劳动”;Diamandis 则估计全球 GDP 接近110万亿美元,其中约一半来自体力劳动,另一半来自脑力劳动。

  • Mostaque 援引 Jevons 悖论:效率提升会降低单位成本,并扩大可行用途。NVIDIA 的回应越来越偏向集成系统,而非单颗加速器;OpenAI 等公司也可以把大规模 GPU 集群从并行预训练转向串行推理、合成数据生成和智能体集群。

  • NVIDIA 的 Project DIGITS 展示了这一终点:价格约3000美元、128 GB 显存、1 petaflop AI 算力和约200瓦功耗,两台设备就能运行 R1。在数据中心规模上,Mostaque 描述的 GB300 NVL72 系统拥有约6 petabit/秒的互联带宽——“相当于整个互联网的带宽”——功耗约100 kW。

  • 按他的粗略计算,4到10台每台300万美元的 NVL72 级设备,就能复现 DeepSeek 的训练运行,耗电约1000 MWh,电费约2万美元。他预计第二年智能手机就能以不超过20瓦的功耗达到 o1 水平,并将每个智能单位的“几瓦”和“几分钱”与 Diamandis 提到的 Microsoft 让 Three Mile Island 重新为数据中心供电相对照。

5. 在位者仍掌握分发,但信任将 AI 切成不同市场

  • Ismail 的安全问题暴露出一个重要边界:开放权重允许本地运行,但大多数人不会这么做,而且适合笔记本运行的版本是蒸馏模型,不是完整的 R1 主模型。Mostaque 提到 Perplexity 正在美国服务器集群上运行 DeepSeek;但 Ismail 仍预计,一些西方公司和印度国有企业会为敏感工作选择本土系统。

  • Mostaque 预计 AI 会分成4层:需要时调用的前沿 AGI;Apple 或 Google 提供的个人 AI;DeepSeek 和 Llama 等开放权重系统;以及面向受监管行业的开源、开放数据决策系统。最后一类必须公开训练输入,因为模型可能继承偏见或蓄意触发器;他以 Anthropic 的 Sleeper Agents 研究为例,说明海量训练集中的几千个词就可能改变模型行为。

  • 在 Mostaque 看来,DeepSeek 应该通过加速廉价智能来提高 OpenAI 的价值。ChatGPT 已经让大约3亿至4亿用户理解了“AI”是什么,相比之下 Gemini 和 Claude 的认知度几乎可以忽略。报道称 OpenAI 实现了30亿美元收入、亏损50亿美元,并花费30亿美元训练模型;更低的训练成本将改善这笔账,而使用数据则会强化 Operator 式产品。

  • 规模仍然会带来组织摩擦。Mostaque 偏好约100人的核心研究团队:Stability AI 曾以80名研究人员和开发者、其中包括16名博士,在多个模态上做到业界领先,但超过150人后协调效率下降。Ismail 将这条边界与 Dunbar 数字联系起来——组织必须在更慢的自上而下控制与自主决策、但工作重复之间做选择。

6. 中国 AI 技术栈从模型延伸到芯片和超级计算机

  • Mostaque 认为,NVIDIA 持久的地缘政治风险是被迫本地化,而不是某一个高效模型。Huawei Ascend 910 芯片虽然效率落后于 NVIDIA,但已经在为 DeepSeek 的 API 提供算力;与此同时,中国已经通过另一条偏重规模的硬件路线建成两台百亿亿次级系统——OceanLight 和 Tianhe-3。

  • 在他的框架中,算力智能会成为国家资本存量,能源则是另一项关键生产率投入。因此,关税和“回流本土”激励也会加入与 Stargate 相同的竞争。他将 Stargate 宣布的5000亿美元解读为总拥有成本,底层投资可能更接近1000亿美元——即便如此,仍低于5G rollout 的成本,却对应着影响更深远的技术。

  • 国内竞争同样激烈。Alibaba 在 DeepSeek 的压力下发布 Qwen 2.5-Max;Mostaque 称 Qwen-VL 在视觉理解上已经达到 Anthropic 和 GPT-4o 的水平。真正的门槛是“够好、够便宜、够快”;一旦跨过这条线,专业化和开放分发的重要性就会超过某个模型是否永久领先。

7. AGI 首先表现为远程同事,然后变成自主组织

  • Mostaque 称,他能想到的几乎所有主要 AI 领袖都预计 AGI 会在3到5年内出现;Diamandis 则指出 Altman 曾暗示可能就在第二年。博弈论上的危险是一个“关键时刻”:某个参与者先实现 AGI,并获得足以瘫痪竞争国家的能力,于是所有参与者都会得出同一个结论——自己承担不起停止建设的代价。

  • 在此之前出现的会是 Artificial Remote Intelligence:一种在 Slack、邮件、Zoom 和公司软件中的表现都无法与人类员工区分的系统。Mostaque 对 AGI 的定义更强,指能够击败一个团队的复杂系统;但远程员工级别的能力会成为第一波自然冲击,因为 AI 可以瞬间吸收整个组织的信息流。

  • 他的烹饪阶梯区分了几个经常被混淆的层级。今天的系统是会遵循配方、工作表现优于人类的“厉害厨师”;“超级厨师”或 AGI 能够发明配方并击败一个团队;智能体团队可以自主获取资源并执行目标;ASI 则会超越人类的组织能力,以极高速度发明创造。当这些团队能够拥有并协调资源时,Wyoming 的 DAO 法律就会变得相关。

  • R1 同时暗示了上行空间和风险,因为它没有经过同样的调优和安全处理:有人拿到代码库后将其速度提升了一倍,另一些人则让它把学术论文合成为新的强化学习算法。“也许这些东西会变得不那么安全;上行空间则是,也许它们会更有创造力。”这让 Mostaque 觉得3到5年的时间表甚至偏保守。

8. 2025年的上行空间是创意丰饶,下行风险从 BPO 开始

  • 对娱乐行业,Mostaque 开玩笑说,最好的结果是重拍《权力的游戏》第8季。背后的严肃机制是,电影平均镜头时长已从几十年前约10秒降至2.5秒,而当前系统已经能以接近完美的控制力生成这一长度的镜头。Mostaque 估计,任何人实现这一目标可能需要1到2年,但一家足够专注的制片厂或许能在年底前拼出完整一集。

  • 他称音乐几乎已经解决,并将即将发布的 Udio 系统称为“疯狂”。AI 在医疗领域已经超过人类,包括在同理心方面胜过人类。医疗聊天机器人可以陪伴人们走完整个治疗过程,尤其是在心理健康领域;而 o3 式测试时推理——他将其重新命名为“thinkference”——可能带来今年最早的一批新科学突破。

  • 他认为最糟糕的情形是业务流程外包业迅速被摧毁。Operator 式系统目前仍“有点差劲”,但一年之内,屏幕背后的任何工作都可能被替代或并行化;远程工作者可能是最先被淘汰的人群。Mostaque 点名外包程序员和呼叫中心员工,Ismail 又补充了软件维护、支持系统及类似职能。

  • Ismail 预计第一阶段会很难看,第二阶段则是顶尖人才产出数量远超从前的软件。Diamandis 引用 Marc Benioff 的说法称,Salesforce 正在减少工程师招聘、重新配置资深工程师,并实现了30%的生产率提升。Diamandis 还提到,IIT 有38%的校招岗位无人入职;Mostaque 补充说,他公司的非工程岗位候选人也必须完成30分钟的 Cursor 课程。

9. 对齐竞赛有走捷径的激励,也没有可靠的控制层

  • 前 OpenAI 安全研究员 Steven Adler 的警告概括了这场争论:“AGI 竞赛是一场下行风险巨大的高风险赌局。”没有任何实验室解决了对齐问题,而竞争加速会降低在有人走捷径前完成解决的机会。Ismail 看不到有意义的代码层面监管;他提出的退路是让一个 AI 监控其他 AI,但这本身又会变成一场军备竞赛。他的结论是,精灵已经出瓶。

  • 人类的脆弱性让技术护栏不堪一击。Ismail 举例称,40%的员工会把停车场捡到的 USB 插入电脑;如果 USB 带有公司标志,这一比例会上升到98%。Mostaque 补充说,未来的智能体集群会像僵尸网络,因此限制顶级 NVIDIA GPU 的访问无法阻止协调运行的开放模型或恶意行为者。

  • 他们共同提出的缓解方案,是广泛可得的、向善的 AI。Mostaque 主张建设与人类繁荣对齐的开放模型,将其作为公共基础设施:一个有韧性、可检查的认知技术栈可以保护用户、建立更安全的默认设置,并减少每个实验室或国家单独竞速的动机。Ismail 称这是“唯一能走通的路”。

  • Mostaque 认为“最大化求真、最大化好奇”定义不清——如果好奇心本身成为目标,就会进入“疯狂科学家地带”。他认为 Meta 和 Google 在优化广告,OpenAI 是在优化用户参与度的消费公司,而各家实验室都在竞速成为第一个建成者。现有模型已经会撒谎。Ismail 将世界末日概率定为50%;Mostaque 认为,在《星际迷航》式丰饶未来与《星球大战》式未来之间几乎没有中间地带,Diamandis 也用《疯狂的麦克斯》作了对照。

10. 劳动力替代将演变为货币政策、意义和能动性危机

  • Mostaque 的核心问题是:“当资本不再需要劳动时,劳动如何获得资本?”屏幕工作可能首先被替代,随后是按照 Diamandis 估计的0.40美元/小时定价的机器人进入实体任务。不同于 Ford 支付工资、让工人购买汽车,自动化企业不再需要广泛支付工资来维持自身生产。

  • 这会切断熟悉的政策联系。美联储的使命涉及利率、通胀和失业,但 Mostaque 称其可能在5年内失效,因为当人们购买的是 GPU、算力和机器人,而不一定增加就业时,利率的含义会发生变化。他预计,以劳动生产率为基础的经济将面对充裕机器产出,并经历剧烈的通胀与通缩周期。

  • Diamandis 将终点称为“技术社会主义”:技术几乎免费地为人们提供食物、教育和治疗,但一个没有难度的游戏会变得无聊。Ismail 将问题拆成两部分:维持食物、水和服务等基本供应链;以及帮助公民重建过去由职业提供的身份认同。

  • Diamandis 警告,如果没有可信的积极未来,人们可能会转向更加极端的意识形态。Mostaque 的替代方案是正和式丰饶:廉价的本地算力可以让危地马拉制作世界级电影或开展世界级科学研究,扭转人才外流,并打破人均能源与 GDP 之间的历史线性关系。但 R1 发布后,仍有6位熟人打电话给他,称自己陷入了“意义危机”,这说明抽象变化会多快变成私人问题。

11. Universal Basic AI 是 Mostaque 分配资本、重建机构的方案

  • Intelligent Internet 的出发点是 Mostaque 的判断:随着智能商品化,API 和 SaaS 收入很可能趋近于零。拟议中的基础设施将组织人类共同知识,可以利用算力保障机构级数字货币,并探索一种挖矿机制,让人们——而不只是资本所有者——通过贡献数据、知识和参与来资助 Universal Basic AI。

  • 癌症是他举出的核心例子:专门的团队和算力可以持续整理论文、试验、专家、风险和治疗方案,形成一个能在智能手机上运行、具备同理心的模型。Diamandis 说世界上一半的人会患癌后,Mostaque 表示,这套方案的承诺是“从此不会再有人独自面对癌症之旅”。他将同一架构扩展到自闭症、Alzheimer’s、教育、法律、信仰和政府。

  • 这套系统不会为每个领域生成一个冻结的单一模型。课程学习先提供共享基础,随后进行专业化、本地化和个人适配——就像模型先进入同一所学校,再分别进入不同学院和大学。开放数据集和小型适配器可以让家庭扩展学校课程,受监管用户则可以检查输入是否遭到投毒,并保持互操作性。

  • Diamandis 将这一论点延伸到长寿领域:尽管医学历史上存在120年的寿命上限,他认为 AI 可以帮助理解40万亿个人体细胞,以及每个细胞每秒约10亿次反应,从而有可能实现他所称的“无限未来”。Mostaque 更广泛的设计选择同样鲜明——是主要把智能体建设成替代人的工具,还是让 AI 在医疗、教育和代议制民主等领域提升人的能动性。“我们第一次可以彻底改变这些生活中重要的方面。”