先锋 趋势 方法 投研 作者
SemiAnalysis 的 Jeremie Eliahou Ontiveros:数据中心与电力全景
返回节目精读

SemiAnalysis 的 Jeremie Eliahou Ontiveros:数据中心与电力全景

摘要

  • 模块化现场燃气发电正成为 AI 数据中心最快的通电路径,已有可信的超大规模云厂商和 AI 实验室项目瞄准 2026-27 年落地。 Jeremie 区分了单机约 500 MW、交付缓慢的大型涡轮机,以及可工厂化生产的 3-4 MW 往复式发动机和 15-40 MW 航改型燃气轮机。Elon Musk 的 Memphis 站点 2024 年已有约 250-300 MW 的现场涡轮机,2025 年可能再增加约 500 MW;Stargate Abilene 则计划部署 300 MW,以及 160 MW 的 GE Vernova 航改型燃气轮机:「现在比的就是上市速度」(“Today it’s all about time to market.”)。

  • 真正持久的机会不只是新增燃气需求,而是燃气设备正在替代柴油备用发电机。 项目可以在等待并网期间用燃气作为主电源,接入电网后再保留同一套设备作为备用;如果训练 GPU 在下行期转为服务高可用推理,这一能力的价值还会进一步上升。Andrew 质疑这类过渡性支出到 2028 年可能消退;Jeremie 则反驳称,燃气与柴油设备的成本大致相当,但燃气要求靠近管道,这会成为选址的决定性约束。

  • SemiAnalysis 认为,超大规模云厂商的资本开支将继续显著高于华尔街预测,因为前瞻性的建设和预租赁指标仍在陡峭上行。 在 2024 年和 2025 年均增长约 50%后,其测算隐含 2026 年增长约 35%-40%、2027 年增长 25%-30%,5 家主要买家 2026 年年度资本开支将超过 5000 亿美元。Meta 含蓄透露可能再增加约 400 亿美元、将资本开支推向接近 1000 亿美元,也支持美元计价的同比增量大致相当这一判断。

  • 最大的会计风险,是 GPU 按 4 年寿命折旧,取代当前服务器约 5.5-6 年的使用寿命假设。 Andrew 转述 Jim Chanos 的说法称,Meta 整体资产的使用寿命为 11-12 年;按 Andrew 的回忆,GPU 当时按约 3 年折旧;他还称 Chanos 的另一种测算隐含了 20 年寿命。历史上的高性能计算系统支持 5-6 年使用寿命,但 Jeremie 承认,如今 GPU 正被以最大利用率运行,其损耗是否更快「谁也说不准」。一个项目仍可能显示约 40% 的 EBIT 利润率,但如果使用寿命缩短,未来某个季度可能确认约 100 亿美元的减值损失。

  • CoreWeave 的优势在于执行速度:裸金属市场的技术差异有限,但这一策略也埋下了严重的周期风险。 通过接手加密矿工的棕地项目、部分项目在不到 1 年内交付,CoreWeave 约 2 年签下超过 2 GW 的容量,而传统建设周期为 18 个月至 4 年。错配十分明显:「最长的 GPU 合同是 5 年,数据中心合同却是 15 年」;一旦替换需求消失,公司将面临 10 年的租金敞口。

  • Oracle 正以投资级资产负债表复制「CoreWeave 路径」,接受长久期基础设施负债,以赢得巨额 AI 合同。 Andrew 援引泄露数据称,一项约 15 年、价值 150亿-200亿美元的 Crusoe 承诺,可能支撑一份约 5 年的 OpenAI 合同;客户合同到期后,Oracle 既有巨大的上行空间,也可能每年承担超过 10 亿美元的义务。Oracle 希望 GPU 容量还能把 OpenAI 的 CPU、存储和前端工作负载吸引至 OCI,但 SemiAnalysis 目前几乎没有看到 GPU 托管带来更广泛云业务增购的证据。

  • 偏远地区将获得更多份额,但廉价燃料或寒冷气候无法替代劳动力、物流、输电和可靠电网供电。 West Texas、Applied Digital 的 Ellendale 站点,以及 Crusoe 已宣布的 Wyoming 项目,都显示出集群正在离开成熟都市圈。完全孤岛式发电可以加快上线,但 Jeremie 称电网是「现场能拥有的最佳电力」;没有输电能力,Permian 等地只能依赖昂贵的过渡电源。节目也讨论了 Alaska 的可能性,但 Jeremie 表示自己尚未专门评估该地区。

  • 更好的芯片不太可能单独令用电需求骤降,而机器人进展也会慢于语言模型。 Nvidia 正大幅提升单位功耗吞吐量,但头部实验室会把这些能效收益投入更强的前沿模型,因为「赚钱的是前沿模型」,电力需求与系统价格因此仍然高度相关。在机器人领域,2 级移动系统可能在 1-2 年内成为值得关注的趋势,但现实世界训练数据稀缺,未来几年快速进化到强 4 级人形机器人的可能性不高。

精读

1. 模块化燃气发电正在压缩 AI 集群通电所需时间

  • Jeremie 开场判断,现场天然气发电将迎来一轮激增;主角不是单机约 500 MW、交付周期长达数年的大型涡轮机,而是可以工厂化生产、部署速度快得多的小型模块化系统。

  • 当前有两种架构正在获得关注:3-4 MW 往复式内燃机,本质上是「巨型汽车发动机」,供应商包括 VoltaGrid 和 Caterpillar;以及 15-40 MW 航改型燃气轮机,主要由 GE Vernova 和 Caterpillar 供应。Jeremie 预计,2026-27 年会有可信的超大规模云厂商和 AI 实验室项目同时采用两类设备,涡轮机的势头可能略胜一筹。

  • 项目规模已经开始变化。Memphis 2024 年约有 250-300 MW;Elon Musk 2025 年可能再增加约 500 MW;Stargate Abilene 预计部署 300 MW,以及 160 MW 的 GE Vernova 航改型燃气轮机。「现在比的就是上市速度。」

  • 这些装机可能从柴油发电机预算中分流,而不是带来完全增量的设备需求:燃气在等待并网期间提供主电力,变电站接入后再转作备用。Jeremie 认为 Memphis 已经采用了这一模式,Abilene 也可能如此。

2. 并网后,备用电源仍有价值

  • Andrew 的质疑是:花费数亿美元采购最终只用于备用的燃气设备,听起来更像上行周期的权宜之计,而不是可持续到 2028 年的设计选择;尤其是在电池性能改善、廉价柴油足以覆盖剩余停电风险的情况下。

  • Jeremie 的反驳是,备用电源一直都是一种看似闲置、但不可或缺的支出;按少数实际运行小时摊算,柴油发电成本可能高达每 MWh 数千美元。西班牙大停电说明,即使设备极少运行,数据中心运营商仍然极度重视不间断运行。

  • 燃气还能在周期不同阶段保留灵活性。训练集群最初可能可以容忍停电,但在下行期,所有者可能停止租用新增容量,转而让现有 GPU 服务推理,此时高可用性就变得重要。「只是从柴油切换到燃气。」

  • 他不认同燃气与柴油之间存在明显成本鸿沟:可比的 Caterpillar 柴油发动机和天然气发动机,价格与成本结构大致相近。真正的区别在于地理条件——柴油需要储油罐,燃气则要求靠近管道。

3. 前瞻指标显示,超大规模云厂商资本开支的美元增量仍在加速

  • 卖方模型通常假设 2025 年之后资本开支增速回落至高个位数或低两位数。Jeremie 认为,半导体周期很少平滑地停在平台期:历史上更常见的是强劲且持续的上行,最终再进入下行周期。

  • SemiAnalysis 看到,自建项目开工量正在飙升,超大规模云厂商的预租赁仍处于异常高位。由于预租赁容量要在未来才能投产,这些承诺是下一年度支出的直接前瞻指标,指向高两位数增长,而不是增速稳定。

  • 增长轨迹十分惊人:2023 至 2024 年资本开支增长约 50%,2025 年再增约 50%,预计 2026 年增长 35%-40%,2027 年增长 25%-30%。5 家主要买家仅 2026 年资本开支就可能超过 5000 亿美元;目前所有信号仍然是「上、上、上」。

  • SemiAnalysis 发布研究后,Meta 给出了最清晰的早期信号:2025 年资本开支约为 650亿-700亿美元,其含蓄指引暗示 2026 年接近 1000 亿美元。按百分比计算,这是增速放缓;但按绝对金额计算,支出大致再增加 400 亿美元。

4. GPU 折旧确实存在不确定性,但看空逻辑经常被误述

  • Andrew 转述 Jim Chanos 的看空框架:据称 Meta 整体资产的使用寿命为 11-12 年,而 Andrew 回忆 GPU 当时按约 3 年折旧;Andrew 还称 Chanos 的另一种测算隐含了 20 年寿命。Jeremie 给出的数字不同:服务器约 6 年,按他的回忆 Meta 为 5.5 年,CoreWeave 的服务器则为 6.4 年。

  • 公开的高性能计算系统和行业经验支持约 5-6 年的使用寿命。真正需要保留的风险在于工作负载强度:如今运营商试图从昂贵 GPU 中「榨出每一瓦电的全部价值」,历史 HPC 系统的寿命未必能完全套用。「说实话,现在谁也说不准」;使用寿命从 6 年缩短至 5 年或 4 年,仍是合理风险。

  • SemiAnalysis 估算,Oracle 最大的 OpenAI 类项目在扣除总部管理费用前,项目层面的 EBIT 利润率可以达到约 40%。但如果硬件只能使用 4 年而不是 6 年,相关公司最终可能确认一笔高度集中的减值损失,某个季度的损失规模或达到约 100 亿美元。

5. 项目合同经济性,比公司整体混合指标更重要

  • 为避免 Andrew 提出的「高速扩张银行错觉」——巨额新增部署掩盖早期项目回报不佳——SemiAnalysis 按项目逐一建模 GPU 云业务,分别列出基础设施资本开支和运营费用,而不是从合并口径的增长倒推出盈利能力。

  • 数据中心成本、运营纪律、融资条件和网络架构,会造成截然不同的结果。仅 1 年前,一些 neocloud 还面临 15%-20% 的债务成本和 20%以上的股权成本;Oracle 高效的大集群网络就是资本开支优化的一个例子。

  • 这些变量叠加后,模型结果可能从一家普通 neocloud 约 5%-10% ARR 的水平,推升至 25%-30% AR 的业务——这是 Jeremie 的表述。节目没有定义 ARR 与 AR 这两个标签之间的区别。

  • 超大规模云厂商似乎也采用类似的项目承销方式,锁定 4-5 年合同,除非出现重大问题或 AI 失败,否则 ARR 基本有保障。长期合同之所以重要,是因为大部分资本开支都在前期发生。

6. CoreWeave 靠先交付容量,在商品化市场中胜出

  • Jeremie 认为,面向 OpenAI、Anthropic 和超大规模云厂商的大型裸金属 GPU 合同,比传统云服务更接近标准化商品:供应商负责建设设施、安装机器并完成网络连接,上层几乎没有多少差异化软件。

  • 长期看,最低成本结构应当胜出;但在当前供给短缺阶段,速度占据主导。CoreWeave 约 2 年签下超过 2 GW,原因在于它承担了其他公司不愿承担的财务风险,并较早与加密矿工合作——后者已经拥有电力和变电站。

  • 这种棕地策略绕开了绿地建设周期。成熟数据中心运营商通常从开工到产生收入需要 18 个月至 4 年,而部分与 Core Scientific 相关的容量不到 1 年就实现了部署。「速度才是真正让他们拿下这些合同的原因。」

  • CoreWeave 的成本可能并非行业最低,但规模带来了信任,也为垂直整合创造了空间,包括通过收购 Core Scientific 实现整合。公司采用了专门为 AI 优化的基础设施方案,而传统运营商仍在沿用常规云业务打法。

7. CoreWeave 与 Oracle 都背负危险的久期错配

  • Andrew 的反驳仍值得保留:CoreWeave 优化的恰恰是上行周期最有效的策略——极致速度、激进承诺和风险吸收。需求只要暂停 6 个月,就可能暴露出那些只有在每一块 GPU 都有买家的时候才显得明智的负债。

  • Jeremie 完全同意:「最长的 GPU 合同是 5 年,数据中心合同却是 15 年」(“Your longest GPU contract is going to be five years; your data center deal is going to be 15 years.”)。如果最初的 GPU 合同无法续上,企业可能还要承担 10 年租金,却没有对应收入。

  • 因此,这种承销本质上是一个长期押注:OpenAI 和更广泛的 AI 行业会持续消耗 GPU 与电力,让后续硬件代际和客户合同不断填满同一批设施。它并不是认为合同期限错配已经凭空消失。

8. Oracle 用资产负债表押注 CoreWeave 式路径

  • Oracle 的策略是由投资级信用背书的「CoreWeave 路径」。这一信用地位让它能够接触 Digital Realty 等经验丰富的运营商;但 Oracle 同时也在 Crusoe 身上押下了非传统赌注,当时后者在纸面上仍像一家没有传统高可用资质的加密矿企。

  • Andrew 援引泄露数据称,约 5 年的 OpenAI 收入由 Crusoe 约 15 年、据称价值 150亿-200亿美元的设施承诺支撑。如果 OpenAI 不续约,Oracle 可能还要在之后 10 年每年支付 10 亿美元以上。

  • 战略上行空间并不止于 GPU。Oracle 直到 2016-17 年才进入云业务,规模仍远小于竞争对手超大规模云厂商;如今它希望 GPU 容量能吸引 OpenAI 的 CPU、存储和传统前端工作负载,约 7 亿周活用户就是这些需求的例子。

  • SemiAnalysis 目前还没有发现太多这类增购正在发生的证据,而且 GPU 基础设施可以轻易连接到其他云服务商。不过,Andrew 的更广泛判断经受住了 Jeremie 的审视:Larry Ellison 在错过第一轮云计算浪潮后押下了一个「大胆的大赌注」,目前看来回报正在兑现。

9. 决定下一批集群扩张位置的,是电力接入和基础设施,而不只是寒冷气候

  • Jeremie 不认同 AI 设施仍将集中在大城市周边的前提。West Texas 正在扩张;Applied Digital 位于 North Dakota 的 Ellendale 站点「离所有地方都非常远」;Crusoe 也宣布在 Cheyenne 附近开发 Wyoming 大型项目。

  • 更偏远的部署预计会继续增加,但劳动力和物流可能压过气候或土地优势。开发商需要把数千名工人带到现场,确保设备可靠运输,并获得光纤、天然气和电力基础设施。节目提到 Alaska 的可能性,但 Jeremie 表示自己尚未专门评估该地区。

  • Permian Basin 展示了缺失的关键条件:天然气充足,却缺乏足够的输电基础设施。完全孤岛式发电可以缩短上市时间,但成本高昂;Jeremie 称电网是「现场能拥有的最佳电力」,理想状态是让燃气发电最终转为备用。电网供电还意味着更低的电价和更高的正常运行时间。

10. 效率提升被再投资于智能,而不是电力节省

  • Andrew 的看空情景是,物理瓶颈迫使行业出现效率跃升:如果未来 GPU 的耗电量降低 50%,即便算力需求仍在增长,GW 级数据中心也可能变得过度建设。Jeremie 接受供给过剩「完全有可能」,并不认为这是荒谬的尾部风险。

  • 但云计算历史指向相反方向。Azure 披露的用电量增长与收入增长大体同步:更高效的 CPU 降低了单位成本,但客户消耗了足够多的新增算力,使总电力需求继续上升。

  • Nvidia 的路线图已经在大幅提升单位功耗吞吐量,但系统价格和总功耗也同步上升,Blackwell 的 2 颗计算 die 就是明显例子。硬件效率提升是真实存在的;未决问题在于,客户会把节省下来的收益留存,还是用来生成更多 token、获得更强能力。

  • 头部实验室选择能力提升,因为最好的前沿模型能带来最强的经济回报。Anthropic 在代码领域的领先地位吸引了使用量,而更便宜的中端模型正面临蒸馏、开源公司、中国实验室和大型实验室的竞争。因此,「赚钱的是前沿模型」,行业仍有动力把能效收益转化为更强智能。

11. 机器人近期更可能实现 2 级普及,而非以 LLM 速度跃迁

  • SemiAnalysis 将机器人划分为 0 级刚性机械臂、灵活的抓取与放置系统、2 级移动四足机器人,以及较弱的 3 级和较强的 4 级人形机器人。这套分类有意简化,但有助于区分当前能力与可投资的阶段性节点。

  • 移动机器狗等 2 级系统已经开始初步量产,未来 1-2 年可能成为一个值得关注的趋势。强 4 级人形机器人仍处于研究阶段,Jeremie 几乎没有看到它们在未来几年内落地的证据。

  • 现实世界数据是瓶颈。语言模型继承了数万亿个互联网 token,而机器人没有可比规模的高质量动作数据;因此,即使进展不断,机器人也很难实现类似 LLM 的加速。

  • 对劳动力的结论仍然谨慎。ChatGPT 能够综合先进研究,却也会自信地坚持说「blueberry 里有 3 个 B」;机器人还要面对更多现实世界的物理挑战。Jeremie 更倾向于使用电子表格类比:自动化改变了会计师的工作,而不是消灭会计师,人的价值或许会转向判断力、关系和信任。