先锋 趋势 方法 投研 作者
SemiAnalysis 的 Jeremie Eliahou Ontiveros 谈 AI 与数据中心的供需动态
返回节目精读

SemiAnalysis 的 Jeremie Eliahou Ontiveros 谈 AI 与数据中心的供需动态

摘要

  • Ontiveros 不接受把“无限”作为投资前提,但其审慎预测仍指向 AI 数据中心短缺加剧。 全球数据中心 IT 容量在2019年至2023年间每年增加约4 GW;2024年,仅 NVIDIA 硬件就新增约5 GW 需求,AI 加速器合计新增7-8 GW。SemiAnalysis 预计,未来数年数据中心建设速度仍将落后于需求,基础设施链条各环节因此都有上行空间。

  • DeepSeek 并未推翻算力支出逻辑,其效率提升仍处于一条已经极其陡峭的趋势之内。 Ontiveros 预计,2年后,达到 GPT-3 水平的模型,其推理成本应降至当前约1/1,200。他认为 Gemini 2.0 Flash 的服务成本更低、表现也优于 DeepSeek。DeepSeek 自身仍受推理容量约束,说明更便宜的智能依然可能带来对更多算力和数据中心容量的需求。

  • 易得文本数据耗尽,增加的是算力需求,而不是终结训练规模扩张。 合成数据生成、强化学习、更严格的验证,以及用超大模型改进小模型,都会消耗大量算力;Ontiveros 认为 GPT-4o 和 Claude 3.5 Sonnet 都是这条更广泛路径的产物。当前最大集群约有100,000块 Hopper GPU、功耗130 MW;头部实验室正规划到2027年落地 GW 级、部分达到2 GW 的园区。

  • NVIDIA 被低估的推理优势,可能在于 scale-up 网络,而非市场熟悉的训练软件护城河。 GB200 NVL72 通过 NVLink 将72块 GPU 以全互联方式连接,带宽无出其右;机架级系统使用3,000-4,000根铜缆。更长上下文的推理模型需要更多内存和网络,SemiAnalysis 因此认为 NVIDIA 的护城河“可能实际上在推理侧强于训练侧”(might actually be stronger in inference than in training)。

  • AI 上行周期的拐点,不是模型变得更高效本身,而是采用率和变现无法支撑实体投资。 Ontiveros 预计,超大规模云厂商的资本开支仍将超预期20-30%,但 GW 级园区最终需要的不只是用户增长。他会关注产品流量、能够获得的 OpenAI 收入指标以及可能的 Claude 收入指标,以及消费者是否继续每月支付20美元或200美元。他说,投资规模最终会大到市场无法承受。

  • 供给短缺使“time to power”(接入电力所需时间)成为最有价值的基础设施产品。 Schneider Electric、Eaton、Vertiv、台湾液冷企业,以及规模较小的工程或制冷公司都能参与其中;大量设备的商品化程度高于 NVIDIA GPU。Talen 式表后核电方案看起来比预想中棘手得多。

  • Bitcoin 矿工拥有稀缺的已接入电力场址,但将其改造成 AI 园区是团队与资本问题,不是简单更换设备。 矿场成本约为50万美元/MW,AI 数据中心则超过1,000万美元/MW,而客户还需要可信赖的运营团队。Walker 的比喻概括了其中的期权价值:矿工是“掉进金矿的一队小丑车”(clown cars that fell into a gold mine);但 Core Scientific 和 Applied Digital 更突出,因为它们较早建立了数据中心能力和行业关系。

  • 矿工手里的电力并不天然适配 AI。 Walker 指出,西德州限电协议以及间歇性的风电、光伏电力,可能不适合 AI 全天候运行的负载。Ontiveros 认为,发电机、现场电池,以及数据中心本已使用的 UPS 系统可以覆盖停电时段,电池储备也可能延长至通常5-10分钟以外。

  • 尽管海外能源更便宜,美国仍是默认选址,胜在速度、劳动力、供应链和经验。 超大规模云厂商自建的大型数据中心中,约75-80%原本就在美国,使其积累了100 MW 规模建设经验。Ontiveros 表示,“目前没有其他国家比美国更懂得如何建设大型数据中心。”

精读

1. AI 已打破旧有数据中心增长曲线

  • Ontiveros 一开始就拒绝“无限”这个词,随后量化了市场热情的来源。2019年至2023年,全球数据中心 IT 容量每年增加约4 GW;2024年,仅 NVIDIA 硬件就带来约5 GW 的新增需求,而 AI 加速器——包括定制 ASIC 和 AMD 的小部分贡献——合计带来约7-8 GW。

  • SemiAnalysis 的测算方式,是把每一块采购的 GPU、CPU 或其他 IT 设备,折算为其运行所需的电力和物理空间。Ontiveros 表示,自2024年以来,市场“几乎全部”由 AI 加速器驱动,生成式 AI 由此明显偏离了此前的行业增长轨迹。

  • 其对2024年、2025年及随后数年的供给侧预测显示,运营商的建设速度不够快。按 Ontiveros 的框架,投资含义很直接:不断扩大的供给缺口,为数据中心容量、电气系统、制冷设备以及更快获得电力的供应商留下了空间。

2. DeepSeek 位于既有效率曲线之下,而非超越曲线

  • Walker 的核心反驳是光纤过度建设的类比:数据使用量可以持续数十年复合增长,但在景气高点建设基础设施的投资者仍可能亏钱。如果 AI 开发者在能力提升放缓后开始优化功耗,今天曼哈顿级别的数据中心可能变成闲置的过剩容量。

  • Ontiveros 的回答是,优化已经在以惊人的速度进行。他表示,2年后,达到 GPT-3 水平的模型,其推理成本应降至当前约1/1,200;因此,DeepSeek 并没有改变这条趋势。

  • 他给出的更有力对比对象是 Gemini 2.0 Flash:服务成本更低,表现也优于 DeepSeek。DeepSeek 的竞争成果确实存在,但这并不意味着前沿模型开发者突然只需要比此前预期更少的基础设施。

  • DeepSeek 自身的约束反而强化了这一点。Ontiveros 称,DeepSeek“完全没有推理服务容量”,拒绝新用户请求,运行在最大 batch size 下,交互性也非常低。他还将其 CEO 与中国排名第二的政治人物会面,以及次日宣布的1,400亿美元国家补贴联系起来,认为这反映出的是对更多算力的需求,而不是更少算力。

3. 真实数据稀缺使训练更加耗算力

  • 目前最大的 GPU 集群约包含100,000块 Hopper GPU,IT 功耗约为130 MW。未来2至2.5年内,Ontiveros 称主要实验室正在规划单体 GW 级园区,部分项目预计到2027年达到2 GW。

  • Walker 问道,既然“互联网上的大部分内容”都已经进入训练语料,集群为什么还要继续扩大?Ontiveros 的简短回答是:正因为真实数据稀缺,实验室必须消耗算力生成合成数据、通过强化学习构建推理能力,并进行成本越来越高的质量验证。

  • Walker 保留了关键的失败模式:高度合成的数据集可能递归放大错误,直到模型自信地编造出一场发生在1942年的 Apple 产品发布会。Ontiveros 并不否认验证难题,他的回答是“再次遵循 scaling law”——投入更多算力,建立更强的校验机制并生成质量更高的合成数据。

  • 更大的模型本身也不一定要成为面向消费者的经济型产品。实验室可以用它们微调和改进更小的模型,Ontiveros 认为这是 GPT-4o 和 Claude 3.5 Sonnet 诞生路径的一部分。前沿模型的价值因此可以体现在教会更便宜的模型,而不是直接服务每一次查询。

4. 尚未开发的视频提供了另一个数量级的数据池

  • 在企业付费让楼宇业主记录现实世界之前,Ontiveros 认为,眼下有一个更大的数据集正处于闲置状态。模型会吸收 YouTube 字幕和其他文本衍生内容,但通常不会用底层视频进行训练。

  • 纳入电影和 YouTube 视频,将提供比 Common Crawl 等网页文本来源“多出几个数量级的数据”。Walker 指出,这个语料库存在偏斜——1,000个 MrBeast 视频并不能代表普通人的生活——但 Ontiveros 强调的是规模:在实验室需要设计方案付费让人们生成新的现实世界数据之前,现有视频已经足够使用数年。

  • 用户平台也在为其提供商生成更多数据。每一次与 ChatGPT、Claude 或类似平台的互动,都会存储在提供商服务器上,因此广泛分发既是变现入口,也是持续获取使用数据的来源。

5. NVIDIA 的推理护城河建立在网络之上

  • Walker 完整陈述了看空逻辑:NVIDIA 估值昂贵,半导体具有周期性,Microsoft、Amazon、Google、Apple 等大客户都可以打造竞争产品。它们并不需要所有场景都达到最先进的性能;性能达到90%,或者落后18个月的加速器,也可能夺取有意义的市场份额。

  • Ontiveros 同意,NVIDIA 的软件优势在推理侧可能不如训练侧重要,但他认为市场低估了公司的整体工程能力。硬件和软件是人们熟悉的两层;高带宽网络是第三层,而且正变得越来越关键。

  • 他给出的最佳样本是 GB200 NVL72:72块 GPU 通过 NVLink 实现全互联,带宽在当时没有任何超大规模云厂商方案能够匹敌。这一机架级设计使用“3,000或4,000根铜缆”,展现出一组表面上可互换的芯片背后所需的系统工程能力。

  • 推理模型和更长的上下文窗口需要更多内存;扩展内存又需要强大的 scale-up 网络。这条因果链引出了 SemiAnalysis 的反常识结论:即使 NVIDIA 的软件差异化收窄,其护城河“可能实际上在推理侧强于训练侧”。

6. 采用率与收入决定上行周期何时结束

  • Ontiveros 对周期的判断非常直接:“如果这是上行周期,事情就会向上;如果是下行周期,事情就会向下。”只要盈利预期仍在不断上调,高估值的重要性就相对较低,这也是 SemiAnalysis 继续看好 NVIDIA、电力基础设施及其他 AI 相关公司的原因。

  • 他预计,超大规模云厂商的资本开支仍将超出预测,不是5%,而可能是20-30%。DeepSeek 不会改变这一判断,因为 Google 已经拥有一个 Ontiveros 认为更好、更便宜的模型;它更直接的影响,可能是压低最先进 API 的高利润率。

  • 真正可能打破周期的是采用率恶化。Ontiveros 会跟踪 ChatGPT、Gemini 和 Claude 的流量,同时关注能够获得的 OpenAI 收入指标以及可能的 Claude 收入指标。最初的抢跑,反映的是下一个用户数超过10亿的平台可能出现;但未来2年规划的实体扩张最终需要收入支撑。

  • 这类似于 Google 收购尚未产生收入的 YouTube:超大规模云厂商历来先锁定用户,再建设变现能力。AI 可能将能力越来越强的免费模型——如 GPT-4o Mini 或 Gemini 2.0 Flash——与高级工具、广告、API,以及每月20美元或200美元的订阅结合起来;但 GW 级投资最终要求这些尝试奏效。

7. 接入电力的时间让价值扩散至发电商之外

  • Ontiveros 更偏好把数据中心基础设施视为 GPU 部署的资本开支驱动型代理。Schneider Electric、Eaton 和 Vertiv 在部分电气及制冷设备领域占据主导;台湾液冷企业,以及规模较小的本地工程或冷却塔企业,也能从中受益,因为大量设备的商品化程度高于 NVIDIA GPU。

  • 供给缺口使“time to power”尤其有价值。Talen 式表后核电安排起初看起来像是解决方案,但 Ontiveros 表示,这类方案后来证明比预期棘手得多,迫使开发商考虑其他办法。

  • 他也同意,发电商和天然气是值得研究的领域,但个人关注重点仍是支撑 GPU 需求所需的基础设施。供需错配会让一些方案变得有价值,而在正常环境下它们可能并不具备经济性。

8. Bitcoin 矿工拥有电力,但转型 AI 的成本高出20倍

  • 矿工过去主要围绕西德州、Wyoming 或 North Dakota 的充裕闲置电力进行优化。这段“电力优先”的历史留下了超大规模云厂商如今看重的资产:一个500 MW 的 AI 项目可能需要约50亿美元,而 Walker 举的例子是,收购现有场址可以在6个月内上线,不必等到2029年自行建成。

  • 矿场的物理外壳并不是 AI 数据中心。Ontiveros 估算,矿场基础设施成本约为50万美元/MW,而 AI 数据中心超过1,000万美元/MW;尤其在矿工需要外包大量工作时,尚未购买 GPU,成本就已经跃升约20倍。因此,客户需要相信矿工的团队、技术执行能力和交付能力。

  • Walker 提出了最有力的反对意见:Core Scientific 数月前就签署了与 CoreWeave 的标志性安排,但尽管需求看起来极其旺盛,几乎没有其他矿工拿下类似的100 MW 以上承诺。如果这些资产真是显而易见的“金矿”,熟悉行业的内部人士就应该更快完成转型、保护股权,而不是激进发行股票融资。

  • Ontiveros 给出两种解释,并未回避这一担忧。一些 Bitcoin 矿业从业者近乎宗教般地坚持 Bitcoin,并预计其价格将达到100万美元;另一些人则缺乏推进数十亿美元项目所需的数据中心高管、技术团队和客户关系。“你总得做出选择。”

9. Core Scientific 和 Applied Digital 的执行路径最清晰

  • Core Scientific 的优势不只是电力。公司更早就与 CoreWeave 建立关系,并拥有 Ethereum 挖矿经验;在旗舰安排之前,已与 CoreWeave 签署 Austin 的16 MW 合同,聘用了有经验的托管业务人员,并提前建立客户关系。这段历史有助于解释为什么 CoreWeave 承担了大部分转型资本开支。Walker 称,市场传闻中的早期报价对应约10亿美元市值,而最终合同的净现值约为18亿美元。

  • Ontiveros 将 Applied Digital 称为可信的第二名。公司在更大的 North Dakota 600 MW 园区内,已经建成100 MW 数据中心容量,建设成本约10亿美元;公司还获得了 Macquarie 的新支持,并签署了一份不具约束力的意向书,Ontiveros 认为该意向很可能发展为约400 MW 的交易。

  • IREN 是他更具投机性的候选,因为公司已在西德州锁定1.4 GW。Walker 指出,当地的限电协议以及间歇性的风电、光伏电力,可能不适合 AI 全天候运行的负载。Ontiveros 认为,发电机、现场储能以及数据中心已经使用的 UPS 电池可以应对停电;通常5-10分钟的电池储备,可能延长至20或30分钟,或者延长到实际需要的时长。

  • 其他例子包括 TeraWulf 约70 MW 的合同,以及 Hut 8 在 Louisiana 的项目。Ontiveros 预计,后者在2025年达到100 MW,并在存在一定不确定性的情况下,于2026年扩展至约200 MW。他认为 Riot 和 Marathon 仍将继续专注挖矿。因此,单纯的兆瓦数无法替代赢得 AI 合同、获得托管业务15-20倍 EBITDA 估值——有时甚至更高——所需的团队和关系。

10. 美国继续在执行速度上胜出

  • Walker 不解的是,超大规模云厂商为什么不去 Qatar 追逐几乎免费的天然气,或去 Brazil 等资源丰富的地方。Ontiveros 的答案是上市速度:超大规模云厂商自建的大型数据中心中,约75-80%原本就在美国,因此美国的供应链、劳动力、并网电力和经验都支持100 MW 规模建设。

  • 便宜能源无法替代专业的电气、机械和管道劳动力。Walker 还提出,政府可能没收一项50亿美元的数据中心与 GPU 投资。Ontiveros 认为这是重大风险,但他表示,即使不考虑这一点,劳动力问题本身也足以让海外建设变得困难。

  • 头部 AI 实验室、超大规模云厂商及其周边生态都在美国,进一步强化了产业在国内的集中。Ontiveros 的结论是:“目前没有其他国家比美国更懂得如何建设大型数据中心。”