Naveen Rao:4D计算、AI的能源墙与超越生物学
Naveen Rao:4D计算、AI的能源墙与超越生物学
摘要
- Naveen Rao公开展示了他所称的“有史以来第1台物理动力学计算机”:Unconventional AI于6月1日完成芯片流片,此时距离公司在1月“正式启动”仅5个月,而且芯片已经在实验室生成图像。 核心数据是:每张图像约耗费500纳焦耳,而GPU需要毫焦耳级能耗——“效率比标准计算机高出多个数量级,原因就在于它根本不搬运信息。”
- Rao此前的履历构成了这场押注的背景:他于2014年创办Nervana Systems,随后将其卖给Intel(并称自己卖得“早得离谱”),执掌Intel的AI部门,之后与团队搭建GPU扩展基础设施,并于2023年与Databricks联手。
- 公司的目标是让功耗效率达到现有硬件的1,000倍,Rao也将时间表从5年压缩至3.5年——“有意思的是,我们确实借助AI更快地解决了非常深层的科学问题。” 更大胆的终局目标是:“这家公司的总体目标,是超越生物学。”
- 推动这一论点的能源测算是:仅Google每月处理的token就超过3200万亿个;按每个token 10焦耳计算,相当于12 GW——而美国数据中心总功耗约40 GW,全球则不足100 GW。 Rao估计:“我们很快就会耗尽能源,大约就是3年左右。”由于token服务成本约50%来自能源,商业逻辑就是“我们的变现效率将达到现有硬件的1,000倍”。
- 生物学提供了可行性证明:人类大脑功耗为20瓦,猴脑为1瓦——与你的手机相同;松鼠大脑则只有8毫瓦。 机制差距在于数据搬运:人类皮层每秒移动约160亿比特,而GPU在内存进出时移动约30万亿比特,芯片内部移动的数据量还要多出“10–100倍”。
- 这种架构超越了传统的冯·诺依曼设计——“把计算和内存放在同一个东西里,我们没有内存接口”——并被命名为“4D计算”:通过芯片堆叠实现3个物理维度,再加上时间这一第4维。 一项关于稀疏性的配套突破,则把连接规模按n²增长的问题变成了“圣杯级”结果:删掉部分连接后,系统同时获得了更高的效率、更强的扩展性和更好的可训练性。
- 在Chamath的追问下,Rao表示完整产品将在“2年内”面世:这将是一套机架级数据中心系统,“token通过网线输入、输出,但内部构造完全不同”。 现有模型可以运行——迁移发生在“模型层”,而不是算子层——但硬件中并不存在通常意义上的矩阵乘法,软件栈也将是Python库,而非CUDA。
- 投资逻辑的加分项是Jevons悖论:Rao称,价格减半可能带来超过2倍的消费量,而将价格降至1/1,000,消费量可能超过原来的1/1,000。 他认为,以1,000倍的幅度颠覆规模约1万亿美元的2030年AI市场——“可能还要更大”——将创造“人类历史上最大的市场”,基础设施形态也会从GW级数据中心转向“遍布各地的大量小型数据中心”,最终延伸至“数十亿个机器人”。
精读
1. AI将在约3年内撞上能源墙——能源已成为稀缺资产
- Rao的履历构成了这场押注的背景:他于2014年创办Nervana Systems,随后将其卖给Intel,并称自己卖得“早得离谱”,之后执掌Intel的AI部门;2020年离开Intel后,他与团队搭建GPU扩展基础设施,并于2023年与Databricks联手。
- Rao根据Google公开数据做了一个粗略测算:每月3200万亿个token × 每个token 10焦耳(模型能耗取低端值)= 单一公司AI服务消耗12 GW;对比之下,美国数据中心总功耗约40 GW,全球则不足100 GW。如果模型规模和需求继续增长,“我们很快就会耗尽能源,大约就是3年左右,这是我的估计。”
- 行业瓶颈已经迁移:机房空间→网络→GPU→能源。“现在首先要考虑能源。我先拿到能源合同,然后再想办法把这些能源填满。”如果能源约占单个token服务成本的50%,Unconventional的主张非常直接:让每1瓦能源的变现效率达到“现有硬件的1,000倍”。
2. 生物学证明,高效智能在物理上是可行的
- 参考数据如下:人类大脑20瓦;猴脑1瓦——“你口袋里的手机功耗大约也是1瓦”;松鼠大脑8毫瓦,却能以“1,000次跳跃、1,000次命中”的准确率完成从一根树枝到另一根树枝的跳跃。“你的手机可以运行超过100个松鼠大脑。”
- 低效的根源在于数据搬运:人类皮层每秒移动约160亿比特;GPU在内存进出时移动近30万亿比特,而芯片内部的数据搬运量还要多出10–100倍。“计算系统中的大部分能耗,都花在了搬运信息上。”
- Rao从历史角度解释称,计算机最初的目标是比替代方案更快,而不是把能源效率作为核心指标——ENIAC所替代的是人类进行炮弹轨迹计算。随着晶体管缩小不再带来过去那种效率提升,他认为整个计算范式必须重新思考。
3. 砍掉中间层:直接在物理规律中计算
- 设计理念是剥离神经网络与硅之间损耗性的抽象层:“你的大脑里没有线性代数……真正产生智能的是神经元的物理规律。我们希望用半导体模仿其中一部分。”他举的节拍器例子说明了这一点:放在滚动木板上的节拍器仅靠物理耦合就会同步,形成一种能够产生涌现式计算的动力系统,鸟群和蚁群也是类似的系统。
- 概念验证产品是UNO,一个基于振荡器构建的开源图像生成模型;随后关于稀疏性的研究改善了扩展性逻辑——删掉部分n²连接不仅节省能源,还让系统更易训练:“这是少数能同时带来更高效率、更强扩展性,并且真正提升性能的结果。”
4. 首次亮相:5个月做出可运行芯片,每张图像约500纳焦耳
- Rao首次公开介绍这项工作时,展示了他所称的“有史以来第1台物理动力学计算机”:公司1月正式启动时甚至还没有团队,6月1日完成流片,随后拿到芯片并取得结果。每张生成图像的能耗约为500纳焦耳,而GPU需要毫焦耳级能耗——这“确凿证明了方案有效”;该方法还可以支持序列建模和语言建模。
- 架构层面的主张是:CPU、GPU和存算一体都属于冯·诺依曼架构,而这里“每个独立计算单元本身就是一块内存”。这就是“4D计算”:芯片堆叠提供3个物理维度,动力学中的时间构成第4维。
- 现有硬件距离“每瓦智能”的热力学极限约有100亿倍差距,而哺乳动物大脑距离这一极限只有1到2个数量级。Rao认为,3.5年内他们可以触及“2D光刻的极限”,目标则是超越生物学,推动小型分布式数据中心和数十亿个机器人出现。按照Jevons悖论,计算成本大幅下降可能扩大需求,而不是简单减少总能耗。
5. Chamath问答:产品路径与生态系统难题
- 在时间表和产品形态上,Rao表示完整产品将在“2年内”出现:它会是托管环境中的一个VM,本质上是一套完整的机架级数据中心产品——“token通过网线输入、输出,但内部构造与现有计算机完全不同。”
- Chamath质疑迁移成本,指出围绕KV cache和现有抽象形成的生态具有“机械式约简”特征。Rao的回答是:“那就把迁移做得真正、真正有吸引力。”迁移发生在模型层,而非算子层;现有模型可以运行,但“完成这次迁移需要相当多的算力”。硬件中没有原生的矩阵乘法;每个时间步都可以分析为当前状态矩阵 × 转移矩阵。
- 团队建设的难点也很直接:动力系统理论家和芯片设计师“彼此并不交流”,而打通这两个领域“实际上是这家公司最具挑战的事情之一”。类似CUDA的那一层——Rao强调它并不是CUDA——将是一套Python库,用来表达“具有随机行为的随时间变化的元素”。