先锋 趋势 方法 投研 作者
一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型 | 对谈研究员逯雨鑫
返回节目精读

一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型 | 对谈研究员逯雨鑫

摘要

  • 一张5090、总计几百美元、两三周,逯雨鑫把一个 Llama 4 2B 微调项目在 agentic 的 TAU-bench 上从约15分推到55-60分。 节目开场曲凯另称,逯此前做过一个基于 Gemma 和 Fable 微调的模型,曾登上 Hugging Face 开源模型排名第一。逯的配方是 QLoRA、200美元 Claude Max 订阅合成靶向数据、实训十几个小时;硬件成本“绝对不会超过一百美元”。V1五天、V2两三周,而他并非 PhD,“最基础的东西是我自学的”。
  • 95%的时间花在数据上,这才是他认为真正的难点。 合成数据“目前还是非常差”,主要用于靶向处理问题(如小模型“过度自信”、没完成却宣布完成);真实数据应占60%-70%,5000条数据可能要亲自审核500条,最终真实用到的是几千条量级。“真正的问题是对数据的洞察力。”
  • 对个人和很多应用公司,SFT是最实际的工业级路径;逯认为RL效果不如SFT。 他用几台8卡H200做过大量实验,称 on-policy distillation 最强,off-policy 和 RL 更多是锦上添花;好蒸馏的标准是锚点与目标一致,“benchmark只是一个考试”。另须警惕 capacity gap:Phi-4 的真实数据规模据他判断在3T以上,蒸馏到小模型时,老师太强、学生太弱,有些能力“你就学不到”。
  • 成本已低到中大型应用公司可以组建小团队自训模型:小模型几千到一万元人民币以内,大模型十几万到二十万元以内,一台H200几万元可支撑十几个员工使用。 训练正在商品化:海外已有一家叫 Ans Off 的一站式微调产品,Hugging Face Jobs也在做类似事情;逯预计显卡供应改善后,成本会像手机流量一样走向更便宜、甚至不限量。
  • 两人的反转叙事:应用公司可能成为 next new lab。 AI Lab往更高层的 research 和预训练发展(预训练可能需要128到264张B300、持续数月),后训练则可能让渡给拥有第一手数据的应用公司;曲凯自陈几周前对应用公司偏悲观,现在认为“模型的价值慢慢往应用公司让渡”,而 AI lab 买数据有点像字节早期买用户——“一开始反而是最低的时候”。
  • 最大尾部风险是开源断供:逯举例说 Qwen 3.7 没发布任何小模型,并担心如果继续不发布,应用公司可能只能自己做后训练,“直接把路堵死了”。 所以想做 AI“不如从现在就开始”。逯仍加入 AI Lab,理由是“肯定还是会有 AI Lab 是赢家的”;曲凯则认为只要有竞争,未来相当长一段时间应该仍会有开源。
  • Local AI是逯判断的“大趋势”,但现场也承认它目前并非人人需要。 驱动力包括拒答、成本与隐私:cybersecurity、生物 research 等领域的用户反馈称 Phi-4 经常拒答;逯自己 local AI 使用率“目前来说并不高”。他提到苹果可能在2027、2028年推出2T统一内存电脑,未来手机或电脑若能运行令人满意的本地模型,用户可能因隐私和成本选择 local AI;曲凯的 pushback 更冷静:“最后肯定还是豆包的用户更多”,隐私更可能由应用公司推动,而非用户主动选择。

精读

1. 非典型背景也能做微调:训模型的门槛被系统性高估

  • 逯雨鑫的路径:data engineer出身,因 GPT 在2022至2023年首次对外开放而开始使用,后来读 AI 方向研究生,靠个人项目走红后才加入 AI lab。“最基础的东西是我自学的……研究生更能提供的是一种方向,只要方向走对了,自学是完全可以的。”
  • 他的分层框架:AI分学术级与工业级,工业界常见的两条路是 SFT 与 RL;“只要把基础补好,每个人慢慢都可以做到”。从 MLP 学起这类基础知识,“对于大部分人来讲没有必要”。
  • 曲凯确认这不是大家已经普遍在做而只是外界不了解;逯的回答是,大家确实都没做,主要因为把事情想得过于复杂。

2. 项目账本:几百美元、两三周、TAU-bench从15分到55-60分

  • 节目开场曲凯称,逯此前做过一个基于 Gemma 和 Fable 微调的模型,曾在 Hugging Face 开源模型排名中排到第一。本期详细讲述的个人项目,则由逯明确说是 Llama 4 2B 微调。选型部分他又提到 Llama 4 在“12B模型”的情况下中文很差,因此不能把本期项目改写成12B模型。
  • 配置:一张5090加 QLoRA,200美元 Claude Max 订阅用于合成靶向数据;租用5090据他估计约一至两美元一小时,真实训练十几个小时,硬件成本“绝对不会超过一百美元”。V1用时五天,V2用时两三周;V2还吸收了 Hugging Face 粉丝或社区用户提供的 Phi-4 珍贵 real trace 数据。
  • 结果:在 agentic 领域对标 TAU-bench 时,原版约15分,提升到55-60分;但其他 benchmark 或多或少会下降,只能针对特定领域提升。曲凯将其概括为:用更强的 teacher 生成数据,再通过 SFT 蒸馏出特定领域的小模型,使其在该领域超过原模型,逯对此表示认可。

3. 全流程:明确目标、选底座、做数据、选方法、反复迭代

  • 逯的流程是先明确目标,围绕 business 而不是追逐热度;再选底座模型。关于 Llama 4,他称自己遇到的一个主要问题是中文能力差,尤其提到“12B模型”时大部分时间都在说粤语;中文方向可考虑 Qwen。
  • 数据管线可以自己扮演用户让 AI 生成,也可以用双模型合成,例如让 GPT-5.6 扮演用户、另一个模型作为实际使用的模型;也可以从 Hugging Face、ModelScope 等平台取得公开数据。
  • 工业界常见方法包括 SFT 与 RL。他的个人项目最后选择 SFT,认为 RL“被吹得很神”,但实际效果不如 SFT;OPD 等其他方法对个人和很多应用公司来说成本较高。
  • 训练脚本、公开数据和 benchmark 基本都有开源版本,可以下载后配合 agent 改成自己的版本。他的个人项目全部使用 Claude 完成;他不喜欢 Codex,认为 GPT 更适合执行和写代码,不太适合规划。

4. 95%的时间在做数据:合成数据只能“靶向治病”

  • 逯的核心经验是,自己95%的时间都花在数据上;真正的难点是“对数据的洞察力”,也是他认为当前 AI 各领域最大的卡点。V1约3天做数据、1天训练;V2两周中约12天做数据。
  • 合成数据质量目前并不好,主要适合靶向处理问题。Llama 4 2B 的一个问题是“过度自信”:跑 TAU-bench 时明明没有完成,却宣布“我完成了”。公开数据和普通真实使用不容易找到这种专门样本,只能通过合成数据做针对性处理。
  • 大部分数据最好来自真实使用,包括自己使用模型的过程,以及公开的 Phi-4 真实使用数据;真实数据约占60%-70%。
  • 人工审核不可省:5000条数据可能需要亲自审核500条。只告诉 AI“帮我做解决过度自信的数据”,生成结果可能“完全不对”,必须不断指出问题、确认目标、重新生成。最多可以做出接近1万条数据,但剔除后实际使用通常是几千条量级。

5. Capacity gap与“好蒸馏”的定义:锚点必须和目标一致

  • 仅看数据往往无法判断训练后的效果,必须一版一版测试。即使数据经过 AI 校对、自己也采样看过,训练后仍可能没有提升,这可能涉及 capacity gap——老师太强、学生太弱。
  • 逯举例说,Phi-4 的真实数据规模“应该是在3T以上”;将这些真实轨迹和作答蒸馏到12B小模型时,能力差距很大,有些内容学生学不到。
  • 他用几台8卡H200做过大量实验,明确表示 on-policy distillation 最强;off-policy 与 RL 更多是锦上添花,而不是用来真正解决问题。SFT以及靶向数据、公开优质数据等,则是他认为实用的蒸馏方式。
  • 好坏蒸馏的判据不在名目,而在锚点是否与目标一致:如果目标是安全边界,却把 benchmark 当锚点,就是坏蒸馏;只要真正把模型分布拉向目标,即使出现 bug 或掉分,也可以是好蒸馏。对很多应用公司来说,benchmark只是一次考试,真实使用比单纯锚定 benchmark 更重要。他的项目锚定 agentic 和 coding,因此获得了较多下载和使用。

6. 成本账与避坑:Qwen的坑最少

  • 逯估计,应用公司训练自己想要的小模型,成本可以控制在几千到一万元人民币以内;大模型可能需要十几万到二十万元以内。Serving 端另有 SGLang、vLLM 等架构问题;如果只是几路或十几路并发,一台几万元人民币的 H200 基本可以满足十几个员工使用。
  • 选型上,他认为 Qwen 的坑最少,训练、infra、脚本和部署都是小模型中较好的选择;Llama 4,以及一款他记得好像叫 Muse 的30B模型,架构不够主流,训练会更复杂。
  • 心态上最重要的是别放弃;不要过度相信 AI,及时查询资料,并参考真实成功案例。

7. 训模型正在商品化

  • 曲凯追问为什么还没有一整套 pipeline 的一站式服务。逯说,除 RSI 以外,几乎所有公司都在考虑这一方向;海外已有一家叫 Ans Off 的公司做出了选择模型、上传数据、直接微调的产品,在 Hugging Face 上也较知名,但价格较贵。
  • Hugging Face 还提供过 Hugging Face Jobs,专门做这类事情;国内外厂商也都在推进把训练变成商品,只是 infra、尤其 serving 端仍有难点。
  • 逯认为中大型公司组建三四人的小团队即可完成相关工作。当前显卡、内存和 RAM 价格较高且供应短缺;他预计供应上来后,成本可能像手机流量一样,从早期的30元人民币逐步走向更便宜、甚至不限量。

8. 反转叙事:应用公司可能成为 new lab,AI Lab往更高层走

  • 曲凯列举了主权 AI、数据标注公司 Mokao、Harvey、Fireworks 等迹象,并提到美国红杉关于 AI 应用公司成为 new lab 的文章。逯判断 AI lab 的数量或价值分工会变化:小型应用公司前期可以由 AI lab 承接,等应用达到几百万或几千万用户后再建立自己的 AI 团队。
  • 曲凯用推荐算法时代作类比:最终拥有应用、场景、商业闭环和用户数据的公司会产生更强的算法能力,而不是由一家第三方中立公司单独提供推荐算法。他自陈几周前对应用公司偏悲观,现在认为 AI lab 与应用公司价值会同步上升,未来模型价值可能逐渐向应用公司让渡。
  • 逯设想的反转是:真正存活的 AI lab 往 research、前沿开发和预训练发展,应用公司接管后训练并保有自己的模型,因为它们不愿分享自己的数据。预训练仍主要由 AI lab 负责,可能需要128到264张 B300、持续数月;在他看来,Kimi、智谱的最大价值就是预训练。

9. 数据像早期买量:他为何仍加入lab,以及开源断供风险

  • 曲凯认为 AI lab 花钱买数据,类似字节早期花钱买用户;逯认同真实使用轨迹很有价值:比如用户用 GPT-5.6 写播客稿或修改内容,AI真正解决问题的过程本身就是有价值的数据。
  • 有些公司提供模型免费使用时,逯认为它们可能需要部署很多 B300,租用或购买成本可能达到几十万、几百万元;免费服务既是宣传,也是在收集真实数据以迭代下一代模型。
  • 他仍选择加入 AI lab,是因为相信“肯定还是会有 AI Lab 是赢家的”,并希望加入一家有机会往 research、RSI、high research level 和预训练方向发展的公司。
  • 他最大的远虑是,如果 AI lab 不再开源,对应用公司可能是“比较毁灭性的打击”。他举例说 Qwen 3.7 没有发布任何小模型,并警告如果不发布,应用公司可能只能自己做后训练,“直接把路堵死了”,因此应用公司应从现在开始迭代自己的模型。曲凯则认为,至少未来相当长一段时间,只要存在竞争,应该仍会有开源。

10. Local AI之辩:拒答与成本是真驱动,隐私可能由公司推动

  • 逯判断 local AI“一定会”发展,并称 API 调用时数据可能被上游看到;他还批评部分中转站处在灰色地带、可能出售数据,并提到身边有黑客威胁数据泄露的案例。随着英伟达及国产芯片发展,他认为每个人最终都可能拥有自己的 local AI。
  • 他提到一则预测:苹果可能在2027或2028年推出2T统一内存电脑,2T内存或可运行当时的 GPT-5.2;未来若手机能够运行令人满意的27B模型,用户可能直接使用本地模型,不再调用上游 API。
  • 陈皮追问本地模型与 SOTA 的差距。逯承认自己 local AI 使用率“目前来说并不高”,但 cybersecurity 和生物 research 领域收到的反馈很多,因为 Phi-4 在这些领域经常拒答,只能考虑本地部署的中等水平模型。他还称,Hugging Face 被 OpenAI 攻击后,最终用中国国产模型并本地部署解决问题;这些均是逯在节目中的说法。
  • 小说辅助也是一个成本场景:写一版小说可能花费几千甚至几万元人民币,用 local AI 辅助后成本会低很多。曲凯则认为,用户未必主动关心隐私,最后可能还是豆包用户更多;local AI 更可能由苹果等应用公司推动,而不是用户个人主动选择。逯表示认同,并总结说只要方便、能解决问题即可。