先锋 趋势 方法 投研 作者
《DeepSeek 恐慌指南:紧急特别节目》
返回节目精读

《DeepSeek 恐慌指南:紧急特别节目》

摘要

  • DeepSeek 所宣称的经济性,挑战了“前沿 AI 必须由最富有的实验室、最好的芯片和数百亿美元基础设施支撑”这一假设。 这家成立约1年的中国公司称,V3 使用受出口限制的芯片训练,成本为550万美元——约为可比 OpenAI 模型的百分之一;但 Kevin Roose 提醒,这个数字需要“打个折扣”看待。如果数据经得起核验,行业的进入壁垒、模型定价和利润率都将下移。
  • DeepSeek 发布 R1 推理模型、随后将模型带给消费者后,技术故事演变成了一场市场事件。 NVIDIA 下跌约18%,市值蒸发数千亿美元;与此同时,DeepSeek 的免费、无广告应用冲上美国 App Store 第一名。R1 被定位为 OpenAI o1 和 o3 的对应产品,其可见的思考过程让提示词不再像“往喷泉里扔一枚硬币”。
  • Casey Newton 的反方判断是,AI 成本快速下降本来就是既有趋势,而不是对整个行业的突然证伪。 Ethan Mollick 分享的一张图显示,在某些情况下,GPT-4 级别推理的成本在几年内下降了1,000倍;而此前美国的投资也为 DeepSeek 提供了可继续搭建的技术基础:“之所以他们能做到便宜,原因之一是其他人先付出了昂贵代价。”
  • 即便 Big Tech 的数据中心不会变成闲置资产,定价压力也已立即出现。 一家大型 AI 公司的一名员工告诉 Kevin,客户已经在询问:如果从 OpenAI API 切换到 DeepSeek,能否节省80%;与此同时,同一批训练服务器和芯片可以转用于推理,随着使用量增长,具备规模优势的既有厂商反而可能受益。
  • DeepSeek 表明,开放模型可以更快缩短与封闭实验室的领先差距,但也放大了地缘政治和安全风险。 R1 的权重可以下载和修改;它会拒绝回答一些政治敏感问题,例如天安门广场相关问题;而 DeepSeek 没有披露清晰的安全计划。Casey 仍警告,不要仅仅因为中国的存在就本能地加速 AI 竞赛,尤其是当相关倡议者可能从冲突中获利时。
  • Jevons 悖论是既有厂商看多叙事的出口,但几位主持人并未把它视为定论。 Satya Nadella 认为,更高的效率会让 AI 变成“我们怎么都用不够的一种商品”,即使单位成本下降,也能维持需求。Kevin 指出,这也正是 Microsoft CEO 在市场抛售期间会说的话;Casey 的结论仍是,DeepSeek 意义重大,但一些反应已经“冲过了滑雪板前端”。

精读

1. DeepSeek 把一篇效率论文变成了消费者冲击

  • Kevin 追溯了 DeepSeek 的起点:High-Flyer,这家成立约1年的中国 AI 公司正是从这家对冲基金中脱胎而出。它第一次获得大规模关注是在圣诞节前后,当时发布了 V3,并称其可以与美国领先系统竞争。

  • 真正令人震惊的不只是性能。DeepSeek 称,V3 使用的是受出口限制的“二流”芯片,而非顶级 H100,单次训练的原始成本为550万美元。Kevin 保留了必要的谨慎,提醒读者对这个数字“打个折扣”看待;但即便如此,这也意味着训练成本大约低至原来的百分之一。

  • 随后发布的 R1,是 DeepSeek 对 OpenAI o1、o3 这类推理模型的回应;几天后,面向大众的应用上线。数百万人下载了这款免费、无广告的聊天机器人,认为它“和 ChatGPT 一样好,甚至更好”,推动这款罕见的中国消费应用登上美国 App Store 第一名。

  • Casey 认为,DeepSeek 的产品设计突破之一,是在回答问题时展示它如何理解查询。提示词不再像“往喷泉里扔一枚硬币”,用户可以看懂模型的思路,并据此提出更好的追问。

2. 抛售重估了 AI 护城河

  • NVIDIA 下跌约18%,市值蒸发数千亿美元,这让 DeepSeek 的意义超越了又一次模型发布。Kevin 认为,投资者担心的是“利润率下滑和商品化”:一个名不见经传的后来者,可能用更弱的芯片和其一小部分投入,就追平了行业领先者。

  • 受到威胁的核心前提是“越大越好”——前沿模型需要数十亿乃至数千亿美元、庞大数据中心和最好的 GPU。如果 DeepSeek 的说法成立,领先模型的成本可能只需数百万乃至数千万美元,这会吸引更多竞争者,并限制服务商的收费空间。

  • Casey 的反驳值得保留:DeepSeek 并非脱离昂贵的美国创新独立出现。“之所以他们能做到便宜,原因之一是其他人先付出了昂贵代价”;早期实验室承担了摸索相关技术的成本,DeepSeek 得以在这些技术之上继续搭建。

3. 更便宜的模型未必会让算力资产闲置

  • Casey 表示自己“没那么慌了”,因为成本下降早已极其剧烈,也是市场普遍预期的方向。他引用 Ethan Mollick 分享的一张图指出,GPT-4 级别推理成本在几年内下降了1,000倍;DeepSeek 只是再次凸显了一条已经启动的曲线。

  • 数据中心投入同样可以复用。为大规模训练购买的同一批芯片和服务器,也能用于推理;随着 AI 采用率上升,手握产能的既有厂商可以承接查询,并围绕这些流量建立业务。Casey 认为,DeepSeek 自己的需求就说明它仍然“恨不得拥有所有这些芯片”,所以它的成功并不能证明出口管制失效。

  • Kevin 保留了短期看空逻辑:他认识的一家大型 AI 公司员工说,客户已经在询问,用 DeepSeek 替代 OpenAI API 能否节省80%。即便算力需求能够延续,模型供应商仍面临压力,因为买家希望推理服务“尽可能便宜”。

  • Satya Nadella 给出的答案是 Jevons 悖论:效率提升可能带来足够大的消费增长,从而抵消节省的成本。他所说的 AI 使用量将“飙升”,或许能够维持 Microsoft 的经济模型;但 Kevin 指出,这正是投资者预期一家处于恐慌中的公司 CEO 会传递的信息。

4. 开放权重正在缩短每一家封闭模型公司的领先期

  • Casey 认为,DeepSeek 的成就有一部分是“精巧地照搬美国开创的技术”。真正的变化在于速度:过去,开放模型通常会落后 OpenAI 或 Google 的系统一截;DeepSeek 则表明,它们如今可以快得多地追上来。

  • Kevin 表示,DeepSeek 展示了如何对 Llama 3 或 Llama 4 这类模型进行蒸馏——在基本不牺牲性能的情况下,让模型变得更小、更便宜。一旦技术路径变得清晰,Casey 说,维持可防守的护城河就会更难。

  • 在 AI 上投入数十亿美元、却持续免费开放模型的 Meta,可能最直接地感受到这种压力。The Information 报道称,Meta 已设立4个内部战情室应对 DeepSeek;Casey 说自己没有独立报道,但相信这些消息。他的辛辣概括是:Meta“本来应该是最擅长照搬别人东西的公司”,现在却遇到了一个更快的模仿者。

5. 开放扩散同时放大地缘政治和安全风险

  • DeepSeek 的模型仍然明显带有中国烙印:据报道,R1 会拒绝回答有关天安门广场的提示词。Kevin 担心,如果中国企业取得领先,其审查法律和价值观可能嵌入广泛使用的 AI,并且很难再被移除。

  • Casey 接受这一担忧,但不相信仅仅因为中国存在,就应当加速 AI 竞赛。当那些拥有可能从旷日持久冲突中获益的投资的人,用地缘竞争为更快的 AI 竞赛辩护时,他会“扬起眉毛”。

  • AI 安全专家担心,能力不断增强的系统可能很快达到通用智能或超级智能,并以人类不愿看到的方式收场。R1 的开放权重意味着任何人都可以下载、运行或修改它,这进一步加剧了这样的担忧:危险的未来系统将“非常难以控制”,也很难被限制在一个国家或一家公司之内。

  • Casey 看不到 DeepSeek 披露过任何安全理念,甚至找不到一名明确的安全研究员:其显然采取的路线是“构建 AGI,把它交给尽可能多的人”,然后看看会发生什么。