Randall Balestriero 教授——无需预训练的 LLM 与 SSL
摘要
对于窄域感知任务,一个随机初始化的70亿参数 Transformer,仅凭约20,000个标注样本就能学会任务,有时还能在LoRA微调下达到预训练模型的水平。 尽管参数量与样本量之比极其悬殊,训练仍然稳定,“几乎就像训练 MNIST 一样”,这动摇了昂贵预训练始终是专用分类器必要条件的假设。
这一经济学含义是有条件的,并非对预训练的一概否定。 Balestriero 表示,下一个 token 预训练对于生成仍然不可或缺,也有助于开放式推理或应对分布变化;更便宜的模型高度专用化,无法回答监督数据之外的问题。但对于固定且同分布的分类任务,预训练“并不优于随机初始化”。
专门化的监督目标可能避开下一个 token 预测中相当一部分计算浪费。 “FAIR 语言模型悖论”认为,训练周期漫长,部分原因在于生成模型必须掌握低频 token,即便这些 token 与下游任务无关。在这些实验中,普通监督训练无需超参数优化,直接“开箱即用”,说明部署路径可能明显更简单。
真正的设计空间,从单任务专用模型延伸到通用的下一个 token 模型,而多任务训练可能捕获其中大部分有用的中间地带。 Balestriero 提议寻找一个最小任务集合——可能是5个多样化任务——在不重建完整下一个 token 预测的前提下,获得可复用的表征。商业上的关键选择因此取决于具体应用:任务预期会发生多大变化,决定模型应处于这条光谱的哪个位置。
Balestriero 认为,token 是机器“思考”中过于细碎的基本单位。 在“I saw this movie for ___ minutes”中,精确预测时长不如表征“经过了多长时间”这一概念重要;“概念 token”或许能提供更有意义的抽象,同时避免无损重建原始语言。
自监督学习与监督学习在数学上通过样本之间的关系相连,而非被各自的损失函数从根本上割裂。 最小二乘监督可以映射到 VCREG、VICReg 或 W-MSE,交叉熵则对应 SimCLR 一类目标。这种对应关系允许研究者把成熟的监督学习理论——包括不平衡校正和神经坍缩结果——迁移到 SSL。
地球数据模型在全球尺度上可能表现强劲,但在岛屿和海岸线附近却变得“几乎随机”,由此产生直接的政策与资源配置风险。 Fourier 基函数施加的平稳性并不适合局部梯度明显的区域;小波能减少部分偏差,但不是普适解。Balestriero 更广泛的警告是,平均准确率会掩盖地理层面的失效模式,尤其当众包数据随人口密度分布时。
精读
1. 任务足够窄时,随机初始化也具备竞争力
Balestriero 的动机实验,将一个经过预训练、再用 LoRA 轻度适配的70亿参数模型,与一个用于情感和职位描述分类的随机初始化模型进行对比。面对约70亿参数和仅20,000个样本,随机模型本应无法学会任务,或只能把数据全部记住;但实际训练曲线“几乎就像训练 MNIST 一样”,而且相比 MNIST 上的 MLP,它的过拟合更不激进。
这种规模进一步放大了意外。计算机视觉此前已经显示出隐式正则化:一个拥有50M参数的 ImageNet 模型,可以从100万个样本中学习,即50比1的参数—样本比;但70亿参数对应20,000个样本,极端得多。Transformer 在视觉任务中也被认为比 ResNet 更容易过拟合,但这一因果语言模型架构却表现出强烈的抑制过拟合隐式偏置。
模型究竟利用了什么,仍是开放问题。Balestriero 提出,可以把注意力熵作为机制可解释性的一个观察窗口,并追问这种行为是否由神经坍缩或类似彩票假设的子网络所解释。他希望进一步探查哪些参数真正有用、每一层是否都在贡献,以及是否只有最后几层学会了任务。
主持人总结称,团队可能重新转向专用模型;Balestriero 对此表示有条件的认同。对于少数固定任务,只要部署“永远不会偏离分布太远”,他预计采用合适架构、基于监督数据专门训练的模型就能表现良好。但最强的结论是存在性的:有些任务中,下一个 token 预测“不是答案”,而且“并不优于随机初始化”。
2. 预训练换来广度、生成能力与行为灵活性
便宜的专用模型并不会自由泛化。一个训练来分类职位描述的模型,可能正确识别职业,却无法判断哪种职业收入更高——如果训练数据从未出现过这种比较。因而,随着任务转向开放式分类、推理、新场景,以及需要超越监督分布进行泛化,预训练的价值就会上升。
生成能力构成一道明确边界:“对于生成,毫无疑问你需要做的就是这个。”一个只能返回“好”或“坏”的分类器,在交互和行为改进方面也不如生成模型灵活:后者的回答可以被质疑、收集,再转化为微调数据;而分类器则需要通过进一步的监督训练来实现护栏约束。
Balestriero 提出的“FAIR 语言模型悖论”,解释了成本从何而来。下一个 token 模型必须在完整分布上学习稀有 token,导致训练缓慢且浪费;监督分类器则可以忽略与目标无关的稀有 token。实践中,团队直接采用普通监督训练,“开箱即用”,无需超参数优化,并观察到“非常、非常稳定的训练”。
3. 多任务目标可能占据有用的中间地带
主持人询问了通用预训练与单任务训练之间的中间方案,例如5个代表性任务。Balestriero 的回答是,这些目标构成一条连续光谱,因为下一个 token 预测本身也可以看作大量二元任务:判断每个候选 token 是否是下一个 token。
研究问题在于设计出“最少数量的任务”,同时获得最多样化的表征。精心选择的多任务目标,可能支持新任务“随时加入”,而无需付出恢复 token 分布每个细节的成本;任务预期的多样性,将决定模型应处于这条光谱的哪个位置。
讨论也质疑,生成基准和精确的下一个 token 预测,是否真正捕捉了理解能力。Balestriero 认为,有意义的预测不必指定每个细节:在“I saw this movie for ___ minutes”中,只要表征一个时间成分,未必需要生成“52 minutes”。由于 tokenization 是“一种无损压缩”,并且接近原始数据,他认为概念 token 会更有意义。
4. SSL 是通用的关系框架,而非监督学习的对立面
在《自监督学习的诞生:监督学习视角》中,Balestriero 与 Yann Le Cun 展示了监督目标如何转化为 SSL 目标:例如,最小二乘可以变成比较样本之间关系的目标。预测“汽车还是狗”,与判断两张图像是否代表同一事物,可以学到等价的表征;差别仅在于对线性探测无关的对称变换。
SSL 的泛化能力更强,是因为它的隐式标签细粒度高得多,而不是因为其损失函数拥有某种独立的魔法。在极限情况下,“每张图像都是自己的类别”,这会阻止不同图像坍缩到一起,并保留未来下游任务可能需要的差异。
主持人还询问,SSL 如何最大化下游任务表现的最差情形,但节选随即转向类别均衡效应,没有直接展开这一论点。因此,现有文字不支持更强的最差情形结论。
Balestriero 的层级关系很明确:“SSL 比监督学习更具泛化性。”标签、相邻视频帧或其他先验知识,只是构造成对关系矩阵的不同方式。核心问题不再是哪一派方法,而是“如何构建这个成对关系矩阵”。
5. 统一理论暴露不平衡问题,地球模型则揭示其代价
这种对应关系将最小二乘监督映射到 VCREG,其变体包括 VICReg 或 W-MSE;交叉熵则对应 SimCLR 一类损失。由此,SSL 可以复用大量监督学习理论:神经坍缩结果“用5行代码”即可迁移,而半监督目标也可以按照样本相对数量加权,而不是简单加一个系数,再通过交叉验证挑选系数。
当前 SSL 目标隐含假设概念分布均衡。在 ImageNet 上,这一假设相对有效;但在 iNaturalist 这类重尾数据集上,它会造成巨大的表征偏差。与其通过数据整理丢弃过度采样的概念,不如利用监督学习对应关系,构造有原则的 SSL 重加权方案,并有可能纳入不同程度的样本噪声。
同样的平均值与尾部之间的矛盾,也出现在地球数据的隐式神经表征中。模型输入地点和日期后,可以在缺少传感器的区域插值温度或降水,但在岛屿和海岸线周边,预测可能“几乎是随机的”。架构解释了其中相当一部分差异,但 Balestriero 也保留判断:不可约不确定性和观测稀疏,可能使偏差无法彻底消失。
Fourier 基函数优于完全不使用基函数,但它施加了平稳性,且局部化能力弱;对于温度或降水急剧变化的区域,这些假设并不理想。小波具备更好的局部化能力,能够消除部分偏差,但“小波不是解决一切问题的答案”;更长期的目标,是让模型从数据中学习合适的基函数,而不是预先固定。
众包进一步放大了地理偏差,因为观测数量随当地用户规模增长。Balestriero 提出一种有条件的混合方案:或许用10%的高质量、均匀采样数据为90%的众包数据提供锚点,同时强调合适的数据分布取决于具体应用。住房模型可以合理地优先覆盖人口密集区域,但环境或生态系统应用可能需要覆盖远离人类聚居区的地方。
在他的框架中,问责应当纳入下游反馈闭环。一旦明确预期的政策用途,下游用户就应建立按地点划分的评估,报告失效模式,并与模型设计者持续迭代,直到系统值得信赖。否则,全球最先进的分数可能掩盖与视觉模型相同的地理盲点——后者主要在北美训练椅子和汽车。