先锋 趋势 方法 投研 作者
(预览)AWS的历史与Trainium的AI未来、OpenAI与Microsoft达成交易、Meta与可穿戴设备的未来
返回节目精读

(预览)AWS的历史与Trainium的AI未来、OpenAI与Microsoft达成交易、Meta与可穿戴设备的未来

摘要

  • AWS重新提速,足以让Amazon的AI基础设施逻辑重回讨论,但还不足以坐实。 AWS营收增长28%,为2022年以来最快;Amazon营收增长17%至1815亿美元,净利润大增77%至303亿美元,部分反映了Amazon对Anthropic投资产生的税前收益。两项数据均超分析师预期。Jassy将AWS部分增速归因于AI agent开发者希望把agent部署在其既有云服务和数据所在的同一朵云上。
  • Amazon最具决定性的优势,是以结构性更低的服务成本满足标准化需求。 Thompson的简化例子是:4家提供可互换产品的供应商,单位成本分别为10美元、9美元、8美元和7美元;若市场出清价为10美元,最低成本生产者可获得3美元利润,并保留继续降价的空间,迫使较弱竞争者退出。Amazon是“反Apple”,其投资目标是成本领先,而非溢价差异化。
  • AWS将定制芯片与服务抽象层结合,让客户无需知道Amazon具体在哪些环节节省成本。 Thompson称,早期Graviton处理器“很烂”,但Amazon可能通过Redshift等托管服务在后台使用它们;Nitro则单独承接网络和虚拟机监控器的工作,让AWS在昂贵的Intel容量上“多容纳大约20%的虚拟机”。
  • 功能广度将AWS的成本优势转化为客户锁定和定价权。 客户先从可迁移的算力和存储开始,随后不断采用一个又一个便捷的专有API,直到“快进到最后,你已经彻底被锁定”。Thompson的“AWS IPO”披露这组数据时,AWS利润率约为17%—19%,市场原本预期仅为1%—2%;他回忆说,如今已进入30%多的区间,甚至可能更高(“the 30s—or maybe even higher”)。
  • 对于大规模AI训练,看空逻辑依然成立,因为NVIDIA的架构越来越把整个数据中心视作一块GPU。 这要求芯片、机架和NVIDIA网络紧密互联,与AWS的专有网络打法相冲突;Thompson称Amazon从未是大型训练玩家,并点名Microsoft、Oracle、Elon Musk和xAI正在为此建设专用数据中心。
  • 推理可能成为反转点,因为相比巨型横向互联集群,效率、利用率和成本更重要。 模型蒸馏可以让模型保持在单颗芯片内,CPU负责调度任务,batch size则帮助GPU保持满载——“这才是真正能卖的东西”。预览在Thompson回答AWS的AI故事是否更好、以及Trainium是否已经死而复生之前结束。

精读

1. AWS重新加速,但市场信号仍然混杂

  • Sharp引用的《华尔街日报》片段显示,AWS增速为28%,为2022年以来最快。Amazon营收增长17%至1815亿美元,净利润增长77%至303亿美元,部分反映了Amazon对Anthropic投资产生的税前收益。两项数据均超分析师预期。
  • Jassy将这轮增长归因于AWS的云业务优势和激进的数据中心投资,同时解释称,AI agent开发者往往希望让agent与既有服务和数据处于同一朵云。
  • 片段发布时,股价盘后涨幅超过4%,但Thompson认为,Amazon当天截至目前“结果还是跌的”。

2. Amazon靠更低成本赢下标准化市场

  • 在供给可替代、需求可扩张的简化假设下,Thompson的框架是:4家提供可互换产品的供应商,单位成本分别为10美元、9美元、8美元和7美元;市场出清价可以由成本最高的边际供应商决定,7美元成本的生产者因此获得可持续的3美元利润。
  • 价格下跌时,成本最高的供应商退出,供给收缩,价格便可能回升;最低成本运营商因此同时拥有韧性和竞争力。“你的成本结构越低,在这个行业里就越有优势。”
  • 他对Amazon“反Apple”的比喻是褒义。Apple依靠硬件、独占软件、开发者生态、网络效应和品牌维持差异化;Amazon则在大宗商品市场上用多年投入构筑成本优势,并将这套打法复制到零售和云业务。

3. AWS用定制芯片和功能广度构筑锁定

  • 早期Graviton处理器“很烂”,但Thompson称,托管服务隐藏了底层硬件。客户购买Redshift得到的是数据库服务,而Amazon可能在后台用更便宜的Graviton算力为其提供支持,并随着时间推移持续改进芯片。
  • Nitro在主处理器之外处理网络、系统管理和虚拟机监控器工作,也就是服务器里的“杂务”。Thompson估计,AWS在一颗Intel芯片上可以多容纳“大约20%的虚拟机”,从结构上形成相对于Microsoft的成本优势。
  • AWS还凭借先发优势和持续不断的功能迭代取胜。它的80/20难题在于:每个客户都希望Amazon替自己消除其他所有人的复杂性,同时保留“我需要的这一个东西”。
  • 客户先承诺保持可迁移,随后不断采用一个又一个方便的AWS API:“快进到最后,你已经彻底被锁定了。”这带来定价权,而成本基础仍允许Amazon提供初创企业抵扣额度、多年期承诺和折扣;Thompson称折扣可能达到80%。
  • 这套经济模型让投资者意外:Thompson回忆,他通过“AWS IPO”披露相关数据时,AWS利润率约为17%—19%,市场原本预期仅为1%—2%;他说如今已进入30%多的区间,甚至可能更高(“the 30s—or maybe even higher”)。

4. 大规模训练暴露Amazon的网络劣势

  • Thompson重新提到的SemiAnalysis批评并没有错:Amazon围绕专有网络做了优化,而领先的AI系统已经从单颗GPU扩展到机架,再扩展到互联数据中心。Jensen Huang所说的“整个数据中心就是一块GPU”(“the entire data center as a GPU”)要求使用NVIDIA网络并采取全系统方案,从而削弱AWS的传统策略。
  • Thompson称,这一担忧“在训练方面完全成立”:训练需要横向扩展,以及芯片和系统之间极低的延迟。按他的粗略回忆,训练在很长一段时间里消耗了全球约60%的芯片,这一状态在ChatGPT出现后还持续了数年;他点名Microsoft、Oracle、Elon Musk和xAI在建设专用数据中心,Amazon则不在其中。

5. 推理可能把AI带回Amazon的主场

  • Thompson给出的条件性转折是:“等到推理到来——如果它真的到来的话。”推理通常会尽量把任务控制在单颗芯片内,包括通过模型蒸馏,而不是协调庞大的横向集群;CPU调度、batch size以及让GPU保持满载会变得更重要。
  • Sharp的判断——Thompson表示认同——是,这一市场应该更趋于商品化;相比训练,效率在推理中更重要,而训练时性能并非唯一考量。
  • 经济学上的终点很重要:理论上,如果所有训练都值得进行,训练在总算力中的占比应该下降,因为训练产出的是一个模型,而模型的价值通过推理实现。这可能有利于AWS的成本打法,但免费预览结束时,Sharp反复追问的“Trainium已经死而复生了吗?”仍未得到回答。