先锋 趋势 方法 投研 作者
AWS Trainium:亚马逊如何打造自有AI芯片|GTC研究员对谈
返回节目精读

AWS Trainium:亚马逊如何打造自有AI芯片|GTC研究员对谈

摘要

  • AWS称,其云端集群目前约有200万颗GPU,并计划在2026年再增加100万颗。 这部分增量相当于“过去15年搭建的全部规模的50%”,AWS据此将其视为客户需求旺盛、且自身能够快速扩容的证据。
  • AWS称,期待在今年引入下一代 NVIDIA Rubin GPU或系统,延续一段接近15年的合作关系。 但仅有GPU实例并不能交付生产级AI:客户在数据管道、成本控制、安全与合规等环节推进到生产环境时会“撞墙”。
  • 在芯片和电力供给受限之际,Trainium是AWS兼顾成本与算力供给的选项。 AWS称,与云端可用的替代加速器相比,Trainium的性价比高出30–40%;AWS据此认为,更丰富的硬件选择有助于客户获得算力供给并实现扩容。
  • Trainium 3的性能目标是Trainium 2的2至3倍,AWS计划在2026年部署超过100万颗芯片,明年还会继续增加。 发言者提到Anthropic与大规模训练和推理有关,但措辞并未明确证明Anthropic正在使用Trainium;他表示,OpenAI实验室可能已经、且未来也会使用Trainium进行大规模训练和行业推理,初创公司也在表现出兴趣。
  • Cerebras合作瞄准的是通过prefill与decode解耦来改善推理经济性。 AWS称,合作的首要目标是降低客户成本,尤其是“每token成本”(“dollar per token”);客户认为,这是生成式AI进一步普及部署的必要条件。

精读

1. AWS计划一年内新增相当于历史GPU规模一半的部署

  • AWS高管称,AWS与NVIDIA的合作始于近15年前,当时AWS是最早提供GPU的云服务商之一,而生成式AI尚未真正形成气候。
  • AWS称,目前拥有约200万颗GPU,并计划在2026年再增加100万颗——相当于“过去15年搭建的全部规模的50%”。
  • AWS称,期待在今年(2026年)引入下一代Rubin GPU或Rubin系统,但未给出更具体的上线时间。

2. 生产级AI远不止GPU实例

  • AWS负责产品营销的负责人称,演示通常只需“几天甚至几小时”,但客户将AI投入生产环境时会“撞墙”。
  • 问题不只是把应用部署在GPU实例上,外围技术栈还包括数据管道、成本控制、安全与合规。
  • AWS强调自身拥有20年大规模运营基础设施的经验,并称其提供规模最大、覆盖最广且能力最深的一套服务,帮助客户将AI应用从概念验证推进到生产环境。

3. Trainium同时应对成本与供给受限

  • 定制芯片延续了AWS降低基础设施成本、扩大硬件选择的战略目标;Graviton在8或9年前开启了这一努力。
  • AWS称,Trainium产品线相较于云端可用的替代加速器,性价比高出30–40%。
  • AWS将这种选择定位为:在芯片、电力以及“介于两者之间的一切”都受到约束时,帮助客户获得替代基础设施,从而避免算力供给限制扩容。

4. Trainium 3计划在2026年部署超过100万颗芯片

  • Trainium 3的性能是Trainium 2的2至3倍;AWS计划在2026年将其部署规模扩大到超过100万颗芯片,次年还会继续增加。
  • 发言者称,Anthropic对训练和推理的需求一直“非常旺盛”,但这段表述并未明确证明Anthropic正在使用Trainium。他补充称,OpenAI实验室可能已经、且未来也会使用Trainium,承担大规模训练和行业推理工作负载。
  • AWS还称,更广泛的客户群体,尤其是初创公司,也在寻求使用Trainium。

5. 推理解耦最终服务于降低token成本

  • Cerebras与Trainium的产品支持通过prefill与decode解耦实现推理。
  • AWS称,合作的首要目标是降低客户成本,尤其是推理成本和“每token成本”。
  • 客户告诉AWS,要部署更多生成式AI应用,关键取决于成本下降。