先锋 趋势 方法 投研 作者
前沿模型架构的未来:Fractile 创始人兼 CEO Walter Goodwin
返回节目精读

前沿模型架构的未来:Fractile 创始人兼 CEO Walter Goodwin

摘要

  • Fractile 的核心押注是,前沿模型推理受限于内存带宽和内存成本,而不只是算力。 Goodwin 希望把 DRAM 的容量和经济性,与 SRAM 系统所代表的“每秒数千个 token”结合起来,从而支持长上下文智能体以及拥有数万亿参数的模型。

  • Goodwin 认为,今天 AI 芯片的多样性,很多只是品牌包装下的架构相似。 NVIDIA 和 AMD 的 GPU、云厂商 ASIC 以及 TPU,普遍依赖 HBM、tensor core 和 TSMC 先进封装。Fractile 的差异化在于,试图在整条技术栈上推动创新,而不是完成前端设计后将物理实现外包。

  • Fractile 在判断模型规模和上下文长度会超过 SRAM 承载能力后,放弃了最初的 SRAM 架构。 SRAM 能提供极高带宽,却缺乏具备成本效益的容量;即便是高速推理芯片,处理长上下文时也可能不得不回退到 GPU。公司转而追求“从全球最便宜的内存”DRAM 中获得极高带宽的平台,预计明年下半年全面投入运行。

  • 公司约 150 人的垂直整合团队,旨在缩短工作负载研究、架构、物理设计、封装和晶圆厂协作之间的反馈周期。 Goodwin 认为,能否在部署中胜出,可能取决于能否结构性地锁定 3 至 6 个月的领先:“如果你能找到一种结构性锁定 3 至 6 个月领先的方法,所有这些落地都会由你赢下。”

  • AI 可能大幅压缩芯片开发周期,但无法消除制造时间或芯片的经济约束。 晶圆厂周转仍需 3 至 5 个月,量产爬坡需要 12 至 18 个月,而一款具备财务可行性的芯片需要 3 至 5 年的摊销周期。因此,设计提速意味着手上同时推进更多“押注”,而不是每几周交付一款全新处理器。

  • Fractile 声称,单芯片带宽可达到 HBM 架构的 25 倍,进而可能改变哪些模型架构具备经济性。 Goodwin 以混合专家模型的稀疏化为例:从 1:16 向 1:128 或 1:256 推进,可能大幅节省计算量,但当前加速器会受带宽瓶颈制约。过去 20 年,算力大约增长了 100 万倍,而内存带宽只增长了约 40 倍。

  • Goodwin 预计,即便前沿实验室开发自研芯片,也会继续向多家硬件供应商采购。 自研芯片可以带来议价能力、供应多元化和控制权,但排他性依赖风险极高:如果竞争对手在算法效率上实现 5 倍突破,实验室可能在重新设计硬件的 9 个月里陷入停摆。独立平台依然有价值,因为它们让实验室能够在模型层面竞争,而不必把生存押在单一路线的架构上。

精读

1. 全栈整合是 Fractile 对 ASIC 同质化的答案

  • Fractile 成立于 2022 年夏季,起步时基于两个相互关联的判断:基础模型会具备广泛的泛化能力,而增加推理时算力可以让语言模型获得类似 AlphaGo 的规模化收益。公司的使命由此确定为,让全球最大规模的模型“快得多、快得多”,包括在极端上下文长度下运行。

  • Goodwin 的行业判断是:表面上的“奢侈选择”掩盖了共同的底层基础。Google 的 TPU、Meta 的 MTIA、Microsoft 的 Maia、OpenAI 的 Jalapeño、NVIDIA 和 AMD 的 GPU 以及其他 ASIC,最终往往都由少数几家 ASIC 公司参与开发和交付。在品牌之下,它们普遍共享 HBM、面向张量的矩阵乘法和 TSMC 先进封装。

  • 传统流程从了解工作负载的架构师开始,经过 RTL 和前端设计,最终由专业团队把逻辑综合为 GDSII——即发送给晶圆厂的晶体管及金属层布局。Broadcom 等开发及供应链服务商会参与项目落地;Goodwin 认为 Broadcom 是其中最大的一家,市值达 2 万亿美元,服务内容包括模拟互连 IP 和针对特定制程节点的物理布局。

  • Fractile 把工作负载分析、前端设计、物理设计、后端实现和先进封装都放在约 150 人的团队内部。这样做的优势,是能够形成“灵活得多的闭环”,从而选择那些可能还要 1 至 2 年才能量产的架构。

2. Fractile 放弃 SRAM 路线,转向可扩展的 DRAM 带宽

  • Goodwin 表示,第一个决定性押注其实是推理本身:最近进入推理市场的一些芯片,在 18 个月前还只是训练芯片。部署成本听起来可能只是边际成本,但“每次部署这些模型都会发生”,因此推理经济性具有结构性的重要性。

  • 在最初 2 年里,Fractile 走的是类似 Groq 或 Cerebras 的 SRAM 路线。由于 SRAM 紧邻逻辑电路,能够提供足够带宽,快速搬运权重或 KV cache,并实现每秒数千个 token 的输出。

  • 到 2023 年末并延续至 2024 年,参数规模和上下文长度持续增长,改变了 Goodwin 的判断。SRAM 的容量成为瓶颈;高输出速度的系统无法处理长上下文任务,因此仍不得不依赖 GPU。

  • 修订后的架构转向高容量、低成本,同时具备极高带宽的 DRAM。Goodwin 所说的“更快的马”之分很关键:更快的聊天机器人只是渐进式改进,而让拥有数万亿参数的模型以每秒数千个 token 运行,可能催生长时间运行的智能体,并大幅提升其性能迭代速度。

3. 更快的设计带来更多押注,而非更多“用完即弃”的芯片

  • Sarah Guo 的反驳值得保留:芯片代际本来就大致每年到来,重大的架构变化则更慢,而物理供应链也施加着无法规避的约束。那么,Fractile 如何可信地宣称架构迭代速度可以像软件一样提升?

  • Goodwin 承认其中存在张力。新模型大约每 2 周出现一次;注意力机制、MoE 稀疏化和注意力稀疏化也可能每隔几周就发生变化,尤其是在中国先进开源系统中。但共同需求仍然存在:高内存带宽,以及极小 batch size 下的自回归生成,由此形成带宽效率、成本和服务速度之间的权衡。

  • 有些延迟是物理层面决定的:即便加急,晶圆厂周期仍需 3 至 5 个月;旗舰平台扩产需要 12 至 18 个月;而芯片必须拥有超过 3 年的有效寿命,才能支撑 3 至 5 年的摊销周期。Goodwin 表示,他“不相信”每几周就能出现一款全新的芯片。

  • 压缩设计周期买到的是选择权。Fractile 希望维持一组动态调整、方向一致且随时可以启动的押注,以便选出能够长期成立的旗舰方案并扩大规模,同时与由 6 至 9 颗定制 NVIDIA 芯片组成的 NVIDIA 系统竞争。最终目标,是可重复地领先竞争对手 3 至 6 个月。

4. AI 让架构跑得比物理更快

  • Guo 转述了一位半导体 CEO 的私下估算:从首席架构师提出想法,到最终完成 GDSII,可能需要 10 年。Goodwin 的经验法则是先质疑其中的假设,把这个时间除以 4,再多减去一些。

  • 智能只是整个闭环的一部分。布局布线要处理 NP-hard 问题,相关算法可能运行数天;有限元、热分析和其他仿真也会形成各自的瓶颈。这本质上是一个类似 Amdahl 定律的问题:即便 AI 可以指导模型研究,研究速度仍可能受实验时间限制。

  • Goodwin 预计,近似方法和类似代理模型的工具能够加速迭代,但短期内不会取代 Cadence 和 Synopsys 的最终签核。两家公司已经与 TSMC 及其他晶圆厂合作数十年,用于验证设计是否符合晶圆厂规则下的 DRC/LVS 要求。他更深层的主张是,应当在每次高成本实验前投入远多得多的推理,甚至在一次真实测试前后进行相当于“100 年”人类思考的分析。

5. 带宽可以重塑模型,也能保住独立芯片市场

  • Fractile 必须服务于今天的“硬件彩票”——那些为 GPU 或 XPU 类系统训练的模型——同时利用其声称的 25 倍带宽优势,对未来架构施加“引力”。Goodwin 将这一机会称为带宽扩展定律,与人们熟悉的 FLOP 扩展定律并列。

  • 混合专家模型最能说明这一点。在智能水平相同的情况下,将稀疏度从 1:16 提高到 1:128 或 1:256,可能减少计算量,但 HBM 系统很难高效服务这类模型。类似地,一些注意力机制对带宽的要求较低,却需要更多算力才能达到同等智能水平。

  • 这种失衡有其历史原因:过去 20 年,算力大约增长了 100 万倍,而内存带宽只增长了约 40 倍。抬高带宽上限,可能减少达到给定智能水平所需的操作数量,而不只是更快地执行现有工作负载,从而成为整体模型性能的乘数效应。

  • Goodwin 预计,大型 AI 公司和云厂商会继续保留多家供应商,以获得事关生存的供应保障,并保持对 NVIDIA 的议价能力。他认为,市场会保留一个把速度置于一切之上的高端细分市场,尤其是在开源模型压力下;否则,所有人都会一直使用 Kimi 模型。单押自研硬件则存在非对称风险:如果竞争对手在不兼容的设计上实现 5 倍效率,一家实验室在追赶期间可能“消失整整 9 个月”。共享的独立平台能让前沿实验室继续在模型质量和推理速度上竞争。