先锋 趋势 方法 投研 作者
LSTM:卷土重来?[Sepp Hochreiter 教授]
返回节目精读

LSTM:卷土重来?[Sepp Hochreiter 教授]

摘要

  • Hochreiter 的核心判断是,扩展语言模型只会让它们更大,不会让它们更聪明。 他认为,LLM 是一种「数据库技术」,把人类知识存进文本,也可能包括代码,再进行重组;它或许能在既有程序空间中走得很远,但一旦进步需要真正的新概念,在他看来就会失效。「我们的路径止于扩展规模。」

  • xLSTM 的卷土重来建立在 3 项架构变化之上:指数门控、基于 Hopfield network 的矩阵记忆,以及并行化。 指数门控允许模型修改此前的存储决策;但由于早期的指数激活会破坏学习,必须加入归一化;更大的记忆可以存储更丰富的结构,而不只是一个标量。

  • Hochreiter 声称,xLSTM 目前在训练和推理速度上都已超过 FlashAttention。 其分块设计在优化后的 attention 与递归之间交替,并根据 GPU 缓存来设定分块大小;如果 xLSTM 的推理速度快100倍,o1/Strawberry 式系统就能用同样的预算进行「多100倍的思考」。

  • 更具差异化的商业机会可能是嵌入式工业 AI,而不是又一个语言产品。 无论序列包含100个还是1亿个元素,xLSTM 使用的都是固定大小的记忆;Hochreiter 认为,这让内存需求可预测,并支持面向机器人、无人机和自动驾驶系统的高速、节能系统。一家未具名的无人机公司据称认为结果「难以置信」,其无人机如今已能自主飞行,但公司没有披露公开基准测试。

  • Hochreiter 不认为有必要把每项推理能力都塞进一个学习模型。 他偏好的路径是构建混合系统,调用形式证明器、数学软件和知识工具:「在我看来,把所有东西塞进一个系统是愚蠢的。」奥地利规模约4000万欧元的「Bilateral AI」项目,旨在把符号 AI 与亚符号 AI 结合起来,构建稳健的工业系统。

  • NXAI 围绕 xLSTM 和神经模拟展开,而不是加入拥挤的通用语言市场。 首笔1000万欧元据称投入了算力和第一篇论文;Hochreiter 表示,7B xLSTM 可以与 Transformer 技术竞争,同时具备速度和能耗优势。据称,公司的模拟工作已将一次汽车设计计算从3周缩短至3分钟。

  • 工业领域最大的主张是,学习得到的抽象可以替代成本高到无法承受的超细粒度数值模拟。 模型不必计算每个粒子或网格点,而是识别数千个元素协同运动的结构——模拟「雪球」,而不是每一片雪花。Hochreiter 表示,一个原型系统可能耗资1亿欧元,或许可以因此避免,但他明确保留前提:「如果这能奏效。」

精读

1. 扩展规模能存下更多知识,却解决不了智能问题

  • Hochreiter 的框架是:LLM 是一种「数据库技术」,把人类知识记录在文本中,也可能包括代码,再通过替换和重组实现泛化——比如把周二换成周三。这种能力很强,但处理的始终是「已经存在」的东西。

  • 决定性问题在于:是否每一段代码实际上都已经被写出来。如果答案是肯定的,重组可能走得极远;但如果进步需要「新代码、新想法或新概念」,Hochreiter 不认为当前的语言模型能够创造出来。

  • 主持人的反驳值得保留:o1 等系统可以生成程序、组合原始操作,并利用测试时计算间接搜索程序空间。Hochreiter 承认:「你可以不断调整,而且会走得非常远。」但他仍然坚持边界:模型无法获得既有组件之外的新概念。

  • 他的直白结论是,更多训练数据主要让系统变得更大,而不是更聪明:「我们只是更大了。」模型正在接近他所称的近乎大脑的规模,但人类只需少量样本就能学习、适应、抽象和规划,方式截然不同。「有些东西缺失了。」

2. 真正的推理需要目标、规则与外部工具

  • Hochreiter 区分了人类推理中的概念——矛盾、归纳、形式规则和结构化证明——与 LLM 所谓的「重复推理」:后者来自输入中已经出现的内容。模型可以替换变量或复现代码模式,但轻微改动仍可能让整个过程失效。

  • 模型可以学会一套形式逻辑,生成语法正确的公式,并把其中的规则应用到新对象上。但 Hochreiter 的疑虑在于语义和方向性:构造证明需要由目标驱动的中间步骤,而在一套形式系统中学到的能力未必能迁移到另一套系统。此类系统仍不完美,通常也不如人类。

  • 面对 AlphaGo 的 Move 37,Hochreiter 接受系统确实创造了新知识,但认为那来自对棋局的理解、蒙特卡洛树搜索和价值函数的结合。他偏好的通用架构同样采取分工方式:调用证明器、Mathematica 或查询工具,而不是把每项操作都强行塞进一个网络。

3. 梯度消失直接催生了 LSTM

  • Hochreiter 记得 Jürgen 极具说服力,也始终充满创作冲动:3名研究者为约50名慕尼黑学生准备研讨课题时,Jürgen 到场就说自己没有准备,但最终每个学生都选了他的神经网络课题。他当时也考虑过成为艺术家,而不是科学家。

  • 在 Hochreiter 的毕业论文工作中,神经网络需要把一条信息保留到序列末尾。他看着屏幕上的数字不断流过,注意到「小得离谱的数字」:梯度已经消失,序列开头不再获得有用的信用分配信号。

  • LSTM 的记忆单元经过特殊构造,使反向信号不再被反复缩放;这样,开头的梯度就可以与结尾保持一致。他把成果写进毕业论文,Jürgen 后来回来问是否应该发表,两人于是完成了论文。

  • Hochreiter 表示,LSTM 仍在 Google 的应用中支持洪水预测,也用于美国和加拿大政府的相关系统,并在这一任务上优于替代方案。它还支撑了 AlphaStar,并在2017年之前主导语言领域,通常与 attention 配合使用;随后「Attention Is All You Need」把整个领域推向 Transformer。

4. Transformer 凭硬件吞吐取胜,而非渐近效率

  • LSTM 的输入门类似早期的 attention,负责筛选哪些序列元素值得存储;遗忘门则降低旧记忆的权重。递归结构与压缩后的记忆交互,每次新查询的交互成本恒定,因此总计算量随序列长度线性增长。

  • Attention 会将每个查询与此前的 key 进行比较,因此在上下文长度上呈二次增长,主要是成对计算。Hochreiter 认为,递归记忆可以让新 token 与由多个早期 token 共同形成的抽象交互,而不只是逐一比较 key-value。

  • 但二次复杂度的 attention 反而跑得更快,因为 GPU 可以并行处理这些比较,而经典 LSTM 只能按顺序更新记忆。FlashAttention 仍然是二次复杂度——「数学没法作弊」——但它对寄存器、快速内存访问和硬件特性的利用极其高效,实际吞吐最终压倒了 LSTM。

5. xLSTM 能覆盖坏记忆,存储更丰富结构

  • xLSTM 项目要回答的问题是:LSTM 能否继承 Transformer 的可扩展骨架,同时修复自身局限。团队并行化了递归、扩大了记忆,并解决了一个关键缺陷:经典 LSTM 一旦做出存储选择,就无法重新修改。

  • Hochreiter 用买衣服举例:模型需要同时考虑价格和是否适配鞋子。当后来出现更好的商品时,模型应该大幅提高它的权重,并压低此前的赢家;但上限为1的 sigmoid 门无法通过施加大于1的因子,抵消此前的降权。

  • 指数门控取消了这个上限;归一化则除以累计的指数输入门,效果「像一个滚动 softmax」。最初的动机是允许模型修改决策,但 Hochreiter 也观察到,模型开始重新学习时会出现梯度峰值;学习动力学为何改善,目前仍只是明确的推测。

  • 矩阵记忆用带门控的 Hopfield network 取代原来的标量记忆,通过加入 key 和 value 的外积,同时降低旧内容的权重。他认为 Mamba-2 与这一设计高度接近——「没有输入门的 xLSTM」——但输入门的缺失在他看来很重要。

6. 分块递归瞄准更低推理成本与实时控制

  • xLSTM 将 FlashAttention 分块与递归更新交替使用,并选择能高效装入 GPU 缓存的分块大小。Hochreiter 表示,这一想法来自 FlashAttention 的开发者,但他声称最终系统在训练和推理上都快于完整上下文的 FlashAttention,这一结果出乎他的预期。

  • 自回归生成暴露了 attention 的弱点:即使使用缓存,每生成一个新词,系统仍要反复查询不断增长的历史。Hochreiter 将 xLSTM 更快的递归推理与 o1/Strawberry 式「思考」联系起来:在其所说的快100倍这一条件下,系统就能按比例增加推理时的计算量。

  • 部署优势在于固定内存:包含100个元素的序列和包含1亿个元素的序列,使用的都是同样设计好的递归状态。Hochreiter 认为,这种可预测性,加上能耗和速度优势,为嵌入式机器人提供了路径;由 Transformer 驱动的智能体可能需要数秒才能作出反应。

  • 一家未具名的公司据称曾在无人机 GPU 上测试 xLSTM,称结果「难以置信」,并告诉 Hochreiter,其无人机如今已经能够自主飞行并进行实时控制。他还把机会扩展到汽车,甚至手机,但称手机场景「也许有些牵强」,因为他不了解其约束条件。

7. 工业 AI 需要符号保证与学习得到的抽象

  • Hochreiter 表示,自己从未见过 AI 系统真正形成全新的抽象:语言是人类创造的,甚至 ImageNet 中目标物体的位置也是由人类选择的。xLSTM 或许能把太阳、海滩和鸡尾酒压缩成「度假」这一概念,但他谨慎地说:「我不知道它能不能做到。」

  • 他的战略答案是神经符号融合。数十年的符号方法可以为学习系统提供工具、稳健性和保证,尤其是在生产流程停摆不可接受的场景;奥地利规模约4000万欧元的「Bilateral AI」项目正在推进这种结合。

  • 目前这种融合仍然「笨拙」:符号研究者提出用机器学习来拟合参数,亚符号研究者则把符号逻辑当成外部护盾。Hochreiter 希望让学习进入形式系统,让形式推理成为集成组件,尽管两个研究群体彼此都存在抵触。

  • 他也否定了干净利落的 System 1/System 2 二分法。人类行为从不假思索地伸手拿东西,到在两条路线之间作出选择,再到长期规划一盘棋,实际上是连续变化的;AI 形成的抽象也可能不同于人类概念,因为 AI 系统以不同方式生活在同一个世界中,并对其进行操作。

8. NXAI 将 xLSTM 与学习正确尺度的模拟结合起来

  • Hochreiter 在大学里难以为 xLSTM 融资,同时又希望把技术留在欧洲,于是创办了 NXAI。一名当地投资人支持「先修好技术,再在其上构建」的思路;首笔1000万欧元投入了算力和第一篇论文。

  • NXAI 目前有两条工业主线。Hochreiter 表示,7B xLSTM 可以与 Transformer 技术竞争,同时具备速度和能耗优势;但他不想与已经集中在语言领域的众多公司正面竞争,因为语言并不是大多数工业企业的核心业务。

  • 神经模拟通过识别相干结构,解决传统数值方法难以处理的超大规模粒子和网格问题。他的类比是:月球可以用位置、也许再加一个冲量和质量来表示;雪球可以作为一个整体建模,而不是逐片计算雪花。合适的抽象能够消除海量冗余计算。

  • 在一个汽车设计案例中,他表示数值模拟需要3周,而学习系统只需3分钟。对于无法按完整规模模拟的炼钢炉,目标是改为模拟真实系统,从而避免一个成本可能达到1亿欧元的原型——但前提仍然是他强调的那句:「如果这能奏效。」