先锋 趋势 方法 投研 作者
159: 马斯克Terafab太空算力、英伟达重拾CPU|与Fusion Fund张璐聊AI算力新趋势
返回节目精读

159: 马斯克Terafab太空算力、英伟达重拾CPU|与Fusion Fund张璐聊AI算力新趋势

摘要

  • Terafab真正要争夺的不是一座芯片厂,而是马斯克生态的算力主权。 计划把 Tesla、SpaceX、xAI 从芯片设计、制造一路整合到部署应用,终极目标是年产 1 TW AI 算力,并将 80%-90% 部署到太空。张璐把它形容为一个“巨大的跨公司的工业操作系统”,但判断落地周期和资金需求都会远超马斯克自己的预期。
  • 太空数据中心在未来两三年并不是一笔成熟的创业押注。 宇宙辐射、芯片封装、发射、维护与故障维修都面临重大技术和成本问题;若服务地球应用还要承受 latency。张璐给出的成熟窗口是七年甚至十年。“如果都要探索在太空里建数据中心,为什么不在临近的加拿大建?”
  • SpaceX需要用“整个太空经济”而非火箭与 Starlink 支撑万亿美元级上市叙事。 张璐认为,轨道部署还对应马斯克更深的诉求:“他不希望有任何政府去监管他。”在太空管辖、轨道执法与月球资源归属都模糊的阶段,SpaceX既可能成为太空经济的主要支持者,也可能成为未来规则制定方。
  • 比轨道数据中心更近的机会,是服务一个“AI native、robotics native”的太空产业。 微重力工厂可探索地球上难以形成的晶体、材料与蛋白质结构;AI还能管理卫星交通和数据交易,机器人则可从月壤提取水、氢、氧,搭建月球“加油站”。真正的空间算力需求要等这些本地应用形成规模后才成立。
  • 当前更可投的是地面 AI infrastructure 的效率层,以及其他太空基础设施。 Interconnect、optical switch、能耗、memory、security、推理成本与系统整合都有明确瓶颈;创业公司还必须回答,是服务未来的大集群,还是自己重资产建设集群。张璐的直接结论是:“我觉得不是一个好时机,我觉得还是有点太早。”
  • NVIDIA正在从 GPU 公司改写为生产 token 的“AI工厂”,推理则把收入从一次性需求变成持续性现金流。 训练与推理的算力占比已从约 70%-80% 对 10%-20% 走向五五开,未来可能倒挂为 20%-30% 对 60%-70%;Jensen Huang据此预计,Blackwell 与 Vera Rubin 到 2027 年对应的数据中心收入可能超过 1 万亿美元。
  • Agent时代会同时抬升 CPU、GPU、LPU、NPU 等异构算力,平台控制力比单颗芯片的胜负更重要。 NVIDIA用 Vera CPU 补上工具调用、代码执行、多 Agent、强化学习与 simulation,并把 Groq 的低延迟、高吞吐推理能力纳入 Vera Rubin;即使 CPU 未必永远胜过 AMD,掌握整机、整柜和一站式采购仍是巨大的集成优势。
  • 企业级 AI 已进入预算、部署与退出同时加速的阶段。 受监管行业更偏好私有云或本地部署的小语言模型,以兼顾准确性、隐私、延迟和成本;Fusion Fund网络中的企业最高已有 120 亿美元 AI 预算,部分不到十人的公司一年收入从零增至 2,000 万美元。金融、医疗、保险、工业与供应链是可能最快落地的方向,去年部分成立不到两年的被投公司被收购并获得 10-20 倍回报。

精读

1. Terafab要把马斯克生态变成一套工业操作系统

  • 曼祺概括的计划是:马斯克在 3 月 21 日提出联合 Tesla、SpaceX 和 xAI,自建从芯片设计、制造到部署应用的全栈产能,终极目标为年产 1 TW AI 算力,其中 80%-90%进入太空。
  • 张璐认为这不是突然冒出的构想。马斯克长期想把芯片、基础设施、模型和终端掌握在同一体系里,核心是“不想被别人去卡住我自己算力未来发展的一个延展空间”。
  • 她以 Google Gemini 的快速提升作参照:自有 TPU、算力、模型与数据,使系统级优化和成本优化更容易。马斯克则想把这种全栈能力进一步接入汽车、机器人、卫星和物理世界,形成“巨大的跨公司的工业操作系统”。

2. 太空数据中心首先撞上辐射、维护与延迟

  • 张璐的第一层保留是宇宙辐射:它对芯片性能的影响“比大家想象的要大很多”,包括 TPU 等芯片应采用何种封装保护,目前仍有现实技术问题。
  • 发射成本即使能被 SpaceX 持续压低,也只是总成本的一部分。大型集群发生硬件故障后,日常运维和维修都极其昂贵,“更高的其实是维护成本”。
  • 算力服务谁同样关键。若支持未来的卫星、机器人和其他太空 AI,本地计算可以降低延迟;若近期主要把结果传回地球,距离带来的 latency 会削弱经济性。
  • 张璐用一个刻意朴素的反例检验能源与冷却叙事:加拿大水、电资源丰富、气候寒冷又地广人稀,“为什么不在临近的加拿大建数据中心”,而要直接跃迁到太空?

3. 万亿美元级 SpaceX需要一个“太空经济”估值框架

  • 张璐明确认为 Terafab 与 SpaceX 上市相关:市场传出的预期估值达到万亿美元量级,而“从来没有公司以这么高的价格去上市”,仅靠火箭发射和 Starlink 很难讲完整。
  • 马斯克希望 SpaceX代表的是 space economy——太空生态、基础设施及其全部潜在市场价值。Terafab、月球基地、轨道服务和边缘计算因此既是长期规划,也是支撑估值想象空间的资产。
  • 她同时强调马斯克确实“一以贯之”:上市叙事并不意味着愿景是假的;如果太空 AI 应用最终形成海量需求,就近建设数据中心的路径可以成立,只是技术和需求成熟仍需时间。

4. 监管真空可能比太阳能更能解释轨道部署

  • 张璐对马斯克动机的尖锐判断是:“他想在太空里面建数据中心,其实很核心的一点是他不希望有任何政府去监管他。”1 TW 规模若落在特定国家,会面对大量监管批准和政治协调。
  • 太空虽有部分国际组织管理低轨轨道,却没有类似领土、领空的清晰管辖体系。谁发射卫星、谁负责移除的规则即使存在,也缺少明确的持续执行者。
  • 这让轨道与月球资源呈现“先到先得”的意味:先发射更多卫星就可能占据稀缺轨道。马斯克不仅可能成为太空经济的主要支持者,也可能成为“未来整个太空经济的一个规则制定方”。

5. 太空工厂是更近的 AI 与机器人应用

  • 张璐认为近期最值得关注的场景之一是太空工厂。微重力或无重力环境可能形成地球上没有的新晶体、材料和蛋白质结构,或制造更完美、对称的晶体,为受材料瓶颈限制的产业提供新选项。
  • 她的核心定义是,太空“天然叫 AI native、robotics native”。把人送上去还要建设维持生命、健康和安全的生态;机器人所需的生存支持更少,因此自动化不是替代人工,而是产业成立的前提。
  • 这也解释了太空数据中心更可信的长期路径:先有太空工厂、卫星网络和机器人系统,再由本地集群支持本地 AI,而不是先把地面工作负载搬上轨道。

6. 卫星交通和月球加油站已勾勒出本地算力需求

  • Fusion Fund一家被投公司用 AI 管理卫星交通,减少卫星碰撞、资产损失和太空垃圾;在管理过程中还可促成卫星数据交易,把高质量数据用于矿产检测、山火预警和气象等地球应用。
  • 另一家公司建设太空“加油站”:机器人从月壤提取水,再分离出氢和氧,三者均可服务火箭或太空飞行。若该路径成立,飞船无需从地球携带全部燃料,可在月球补给。
  • 张璐设想每颗卫星都能成为小型 edge device。只有当卫星数据、自动化设施和太空 AI 应用达到足够数量,就近的数据中心才同时具备需求基础和 latency 优势。

7. 轨道数据中心的创业窗口可能还需七到十年

  • 曼祺提到已在做太空计算服务的美国公司 Starcloud;张璐也知道该公司,并称其正与前述月球加油站项目讨论合作。马斯克的愿景确实已加速资本关注。
  • 但她不认为这是未来两三年的成熟机会:轨道数据中心可能需要七年甚至十年的技术周期,等待封装、发射、维护成本成熟,也等待太空经济产生足够多的本地工作负载。
  • 对创业者,她的回答没有模糊空间:“我觉得不是一个好时机,我觉得还是有点太早。”更合理的观察期是未来三到五年,再按太空生态实际增长速度决定是否进入。
  • 资本结构也是边界:数据中心是重资产生意,创业公司要想清楚,是亲自拥有集群,还是提供让集群更高效的软硬件与太空基础设施服务;后者当前更适合初创企业。

8. Terafab带出的近期机会集中在集群效率层

  • 张璐把机会从“再做一颗芯片”扩展为完整 AI infrastructure:数据中心成本、耗电、网络、存储和系统协同都决定实际性能,基础设施本身将像能源与交通一样形成护城河。
  • 她举出的具体标的是下一代 interconnect 与 optical switch。AI耗电不仅来自训练,大量电力花在 communication 和传输;更快、低耗的互联是大规模部署的前提。
  • 资本风向也在改变:过去只投软件的大型 VC 开始进入 deep tech,重点寻找能解决 AI 基础设施瓶颈的硬件和软件。Terafab更像需求信号,而不是要求所有公司复制它的资本开支。

9. NVIDIA正在把自己改造成生产 token 的 AI工厂

  • 张璐在 GTC 观察到,Jensen Huang不再把 NVIDIA定义成芯片或 GPU 公司,而是“全栈式的人工智能基础设施公司”,核心叙事是支持下一阶段的 token economy。
  • 产品单位也从一颗芯片变成生态:她回忆自己求学时,一家公司一年发布一两颗芯片已很快;本届 GTC则一次发布七颗芯片,并连同 interconnect、推理基础设施和软件平台整体推出。
  • NVIDIA卖的“不只是一张卡或者一个芯片”,而是包含 GPU、CPU、网络、存储、CUDA、Agentic AI 和 inference 部署方案的完整系统。客户的采购问题也从选哪家芯片,变成向谁购买整套 AI工厂。

10. 推理把算力需求变成持续性现金流

  • 张璐将训练称为“一次性的现金流”:模型在某一阶段集中消耗大量 GPU;推理则会随着产品使用持续发生,尤其当 Agent长期在线、频繁调用工具和数据之后,它成为“持续性的现金流”。
  • 她回忆,早期讨论中的算力结构约为 70%-80%用于训练、10%-20%用于推理,如今已接近五五开;未来可能倒挂为训练 20%-30%、推理 60%-70%。
  • Jensen对 Blackwell 和 Vera Rubin 的判断也建立在这项假设上:到 2027 年,对应的数据中心收入可能超过 1 万亿美元,前提是 token 消耗及推理负载远高于早期训练需求。

11. Agent让 CPU重新进入 AI算力的核心位置

  • Fusion Fund此前的行业研究已发现,部分新模型架构在 CPU 上比 GPU 更高效。张璐据此判断,未来 AI训练和部署不会只由一种计算架构完成。
  • Agent不只是生成 token,还要持续调用工具、执行代码、协调多个 Agent;强化学习、simulation 等流程也大量依赖 CPU。Agent从偶发问答变成持续运行后,CPU需求会同步上升。
  • NVIDIA此次推出 Vera CPU,并将其定义为面向 Agentic AI 和 reinforcement learning 的处理器,据称效率比传统 CPU 有两倍提升;首批合作方包括阿里巴巴、字节跳动、Oracle 和 Meta。
  • 掌握 CPU还有平台意义:若 CPU仍在别人手中,NVIDIA就无法完整定义整机、整柜性能。即使未来 AMD的单颗 CPU更强,NVIDIA的一站式采购和集成优势仍可能非常大。

12. Groq与两笔早期收购补齐了 NVIDIA平台

  • Fusion Fund去年有五家公司被收购,其中两家买方是 NVIDIA:贾扬清创办的 Lepton AI,以及焦建涛创办的 Nexusflow。两家公司成立均不到两年,NVIDIA从年初接触到收购、内部整合都推进很快。
  • 张璐透露 Lepton随后进入 NVIDIA的 DGX 平台,成为其 GPU 云布局的一部分。具体整合细节受限制不能展开,但网站快速跳转和产品上线体现了 NVIDIA“看到能力就立刻收进生态”的执行方式。
  • Groq成立于 2016 年,创始人曾是 Google TPU项目核心成员;其路线不是修补 GPU,而是重新设计低延迟、高 token 吞吐的推理路径。优势受特定模型规模限制,却能补足 GPU加 CUDA的通用训练与推理能力。
  • 据节目引用的报道,交易价格约 200 亿美元,并采用非独家技术授权加人才收购的特殊结构。张璐直言,Groq单看芯片“不值得英伟达付的这个价格”,价值在于让 Vera Rubin拥有 CPU、GPU、推理加速器、网络和存储的完整故事。

13. 全栈竞争最终会延伸到世界模型与真实三维数据

  • 张璐观察,当前具备相对完整全栈能力的是 Google、NVIDIA与 Apple;Apple欠缺自己的 AI模型,但芯片、产品和终端完整。Meta等公司也在通过投入和收购补芯片能力。
  • 她把模型演进概括为语言模型、multimodal、Agent,再到世界模型;后一阶段不仅需要模型,还需要高质量的三维真实世界数据。
  • 这正是她看好马斯克生态的原因:Tesla提供交通、工厂和真实视野数据,SpaceX拥有工程、卫星和太空数据,未来还可能加入人形机器人相关数据。其他公司可能只有视频,马斯克拥有的是多样化“三维世界的真实数据”。

14. xAI的人事震荡体现了马斯克的速度与代价

  • 张璐认为联创陆续离职可能说明模型能力提升速度低于马斯克预期;他的目标不是追赶而是超越,因此一旦判断方向有误,就会迅速调整。她以“done is better than perfect”概括创业中的调整逻辑。
  • 他招人时却极具耐心:张璐认识的一位联创被马斯克连续说服三年。加入后,团队常工作到凌晨五六点,因为马斯克可能凌晨一两点到公司继续头脑风暴。
  • 她给出的浓缩评价是“一个很有魅力的暴君”:愿景、内驱力和招募能力都极强,但他把目标置于人情、得失和牺牲之前,“觉得不行他马上做调整”。
  • 张璐不因此对 xAI悲观。并入 SpaceX后,它能调动 Tesla和SpaceX的人才和资源,以及真实世界、卫星和太空数据,已不是普通初创公司;SpaceX未来若受太空经济托举,xAI也可能随之加速。

15. Google TPU的优势主要存在于 Google全栈内部

  • Google投资 TPU已超过十年,说明其很早便意识到推理的重要性。TPU与 Google的模型、数据、现金流和应用反馈共同优化,构成 Gemini快速提升的重要基础。
  • 张璐记得 Google内部使用 TPU时,training cost约为 OpenAI ChatGPT的三分之一;关键不是芯片孤立胜出,而是系统级性能与成本优化。
  • 第三方缺少 Google完整技术栈,使用 TPU时性能和成本都会打折。曼祺补充,Google通过 JAX等软件体系及支持 Google校友创业,可能逐渐扩大熟悉这套架构的开发者群。
  • 张璐仍不认为 TPU短期会有效威胁 GPU:金融、医疗、保险等行业的 AI渗透可能还不到 1%,总需求足以容纳多种架构;NVIDIA同时用 CUDA和更完整的平台提高迁移成本。

16. 企业级 AI的预算、收入与退出通道正在同时打开

  • 张璐看到的共识是,金融、医疗、保险等高监管行业更需要垂直小语言模型,并在本地或私有云部署。它们追求低延迟、低幻觉、数据隐私和成本优化,而不是把全部数据交给通用大模型。
  • 数据本身还不是资产:企业要先做 data curation,再加入安全与隐私中间层,才能连接 AI应用。Fusion Fund约有 45 位全球千强企业 CTO的 CXO网络,其中最高一笔企业预算达到 120 亿美元,一些金融、保险公司三四个月即可完成新的人工智能技术整合。
  • 医疗是张璐最看好的垂直方向之一:美国医疗约占 GDP的 20%,礼来与 NVIDIA达成数十亿美元合作,ChatGPT和 Claude也推出医疗专属产品;高质量数据、小模型和 federated learning有助于降低机构对数据隐私的顾虑。
  • 金融、医疗、保险的整合速度可能最快,物流、供应链和工业 Physical AI也在扩张。部分不到十人的 B2B团队一年收入从零增至 2,000 万美元,因为传统企业更愿与初创公司合作,而不愿把核心数据交给大型科技平台。

17. 美国市场以快速采购和并购循环放大小团队价值

  • 张璐把全球 AI人才聚集美国归因于商业化效率:JPMorgan Chase等传统银行正快速整合 AI;Koch Disruptive Technologies可把技术导入旗下企业,合作周期甚至只有一两个月。
  • Fusion Fund去年五家公司被收购,其中四家成立不到两年,部分交易带来 10-20 倍回报。张璐承认更希望公司长期做大,但这种“短平快”的退出促进资金、人才和连续创业者循环。
  • 曼祺在结尾把组织形态概括为两端:Tesla、SpaceX和 NVIDIA走向超级垂直整合;她还以个人开发者 Peter Steinberg 的 OpenClaw为例,认为个人或极小团队做出产品后被大平台吸收,是相对确定的创业机会之一;节目后记称 Peter在 OpenClaw走红后很快加入 OpenAI。
  • 她还以 Groq约 200 人、200 亿美元交易估算,“相当于一个人就值一亿美元”。
  • 张璐接下来仍会围绕第四期基金推进投资:去年投十家公司,今年计划再投七至十家,并支持三家公司上市。个人重点是 inference cost、能源、memory、security和系统整合,以及医疗机器人、微型或纳米机器人;太空经济则仍是未来两三年的重点观察和投资方向。