先锋 趋势 方法 投研 作者
动态 AI 的黎明:RFT 上线,专访 Predibase CEO Dev Rishi——来自 Turing Post 的《Inference》
返回节目精读

动态 AI 的黎明:RFT 上线,专访 Predibase CEO Dev Rishi——来自 Turing Post 的《Inference》

摘要

  • RFT 正在成为企业从静态模型走向持续进化系统的一条路径。 Dev Rishi 表示,“训练一次、永久学习”正在从今天开始:客户通常使用一个已经由他人完成“99%繁重工作”的模型,再加入最后1%的定制。当前,RFT 只是多种有效调优技术之一,仍是一次性流程;它更大的价值在于成为在线反馈闭环的一部分。RFT 只需“大约十几个样本”,再配合对行为进行评分的奖励函数,而不需要监督微调所依赖的大规模标注数据。以代码为例,格式正确得5分、成功编译得10分、单元测试通过得20分:“只要能衡量,就能改进。”

  • 关键基础设施是连接部署、评估与后训练的反馈管道。 Predibase 已推出从生产部署中自动收集提示词和响应的能力,并在研究如何让 RFT 利用少量用户反馈学习,同时结合 DPO 等技术。早期医疗公司已开始将 LLM 评审结果与患者对话中的临床医生标注结合起来,但 Dev 强调,目前这样做的还只是“最前沿的公司”。

  • Agentic AI 的商业瓶颈在可靠性,而不是演示能力。 Dev 将 Agentic 工作流描述为多次 LLM 调用,通常还会使用工具;错误会沿链条累积。按他的例子,5次调用即使每次准确率都达到90%,最终用户体验仍可能“低于50%”。许多演示能沿着“黄金路径”运行,但生产环境要求系统在用户偏离路径时依然稳健。

  • 企业 AI 正在分化为专业化系统,而不是汇聚到一个通用模型上。 Dev 最喜欢的一种客户表述是:“通用智能很好,但我不需要 POS 系统背诵法国诗歌。”他预计,面向窄领域自动化的 Agent 将主导大量企业场景,而广泛的通用能力可能对消费者更有价值。企业会在不同参数规模中混用开源和商业模型,为每项任务选择最合适的工具。

  • 只有把生产可靠性、效率和学习能力纳入其中,推理才具备可防御性,而不只是提供一个模型端点。 一个大模型可能需要8张或16张 H100 才能运行一个副本,而业务关键型部署还可能要求99.9%或99.999%的 SLA、容错、蓝绿更新和多区域复制。Dev 预计基础模型端点会商品化;Predibase 所谓的“智能推理”则是把服务直接连接到后训练和持续改进。

  • 开源模型缩小性能差距的速度快于 Dev 的预期。 他说,DeepSeek R1 或 V3、Qwen 3 和 Llama 4 已经追平领先商业模型,在部分基准测试中甚至领先;在他看来,这一里程碑比预期提前了大约6个月。相比之下,2023年 GPT-J 还是最好的开源模型,但远远落后于 GPT-3.5。开源推理模型还会暴露 reasoning tokens,让评估从只看最终输出,扩展到分析得出答案的步骤。

  • Dev 认为企业单位经济学颇具吸引力,但担心买方把目标放在了错误的应用上。 他说,与“每百万 token 50美分或1美元”的成本相比,与生成式 AI 合作的 Fortune 200 CIO 很少质疑 ROI。真正的风险是把预期押在炫目的多 Agent 演示上,随后在脆弱系统无法创造实际商业价值时迎来一场“幻灭崩塌”。

  • 更可能胜出的开发节奏,是先交付一个60%的方案、验证需求,再用生产数据持续改进。 Dev 看到越来越多大公司采用创业公司的循环:先验证产品市场匹配,再完善系统,然后收集持续学习所需的反馈。他导师的一条规则概括了这种运营哲学:“如果你发布的东西还没有让自己至少感到一点尴尬,那就是等得太久了。”

精读

1. RFT 将后训练变成实时反馈闭环

  • Dev 认为,“训练一次、永久学习”正在从今天开始。客户通常拿来一个由模型创建者完成“99%繁重工作”的模型,再加入最后1%的定制;如今,他们开始用一个在部署过程中持续改进的管道,取代这个静态产物。

  • RFT 通过将“大约十几个样本”与评分标准结合,降低了对大规模标注数据集的依赖。Dev 以代码为例:格式正确得5分,输出成功编译得10分,单元测试通过得20分——模型朝着明确可衡量的结果学习。如今,他将 RFT 定义为多种有效调优技术之一,也是一次性训练流程;更大的变化在于,它最终成为持续反馈闭环的一部分。

  • Dev 表示,他认为 Predibase 是最早提供端到端 RFT 平台的公司;该能力在几个月前上线。Predibase 还推出了从生产部署中自动收集提示词和响应的能力,以解决数据瓶颈,同时支持包括 DPO 在内的反馈方法,并在研究如何利用用户反馈数据开展 RFT。

  • 医疗公司开始将 LLM 评审结果和患者对话中的临床医生标注,输入早期 RFT 闭环;后续工作将展示少量反馈样本如何影响性能,以及这些提升如何随反馈增加而扩展。Dev 强调,目前这样做的还只是“最前沿的公司”。

2. Agent 暴露累积误差与薄弱评估

  • Dev 将“Agentic 工作流”定义为两部分:一条由多次 LLM 调用组成的链路——一次性的文档分类不算——以及可能存在的工具调用,让 Agent 能够代表用户调用函数。他举的例子是一个医疗助理,帮助用户理解诊断结果并安排复诊。

  • 他对当前热潮的质疑是运营层面的:Agent“相当脆弱”,经过包装的演示往往只能沿着“黄金路径”运行。Dev 表示,5次连续调用即使每次准确率达到90%,也可能已经意味着“低于50%”的用户体验,因此最后几个百分点的质量提升尤为重要——他在参与 Google Assistant 时也观察到过同样的规律。

  • 评估仍是一个开放问题,因为输出有的可以客观分类,有的只能凭主观判断是否“好”。Dev 认为目前有3种可行方法:在有条件时使用历史留出数据、让更强的 LLM 充当评审,以及将产品推向市场收集方向性反馈——这意味着“我们不应低估其中有多少部分如今靠的是感觉”。

  • 主持人提出的反驳是,闭源模型发布会引入新的人格,迫使团队重新建立一套评估“感觉”。Dev 的部分回答是开源推理模型:DeepSeek R1 会暴露 reasoning tokens,让团队评估模型得出答案所使用的步骤,而不是只给答案本身打分。

3. Predibase 押注企业智能将走向专业化

  • Predibase 最初的使命是让深度学习普及化;2022年初,使用 BERT 等预训练模型进行微调是其最受欢迎的工作流。2022年底,当 OpenAI“比我们所有人都更彻底地普及了深度学习”后,用户旅程和用户画像从专业 NLP 工程师转向了新一代 AI 开发者。

  • 公司在2023年初将产品重点转向 LLM,押注生产环境中的模型会走向专业化和定制化;同年晚些时候,它又大举进入推理领域。Dev 将其描述为对原始使命的彻底转向,或者是一次大幅聚焦。

  • Checkr 体现了这一企业判断:它的模型提取具体的刑法条款、违规行为和背景调查细节,而不是编写 Python 或背诵法国诗歌。Dev 预计,面向窄领域自动化的应用将占据企业价值的主导地位,同时承认广泛的通用能力在消费产品中可能仍更有用。

  • 到2025年,他的结论已经是确定性的:“我们不会生活在一个由单一模型统治一切的世界里。”企业会在不同参数规模中混用开源和商业模型,为每项任务选择最合适的工具;他预计,窄领域 AI 用例的增长速度甚至会快于整个 AI 市场。

4. 生产推理是运营与经济学问题

  • 初始推理对有能力的工程师并不难,尤其是借助 Predibase 的 LoRAX 等开源框架。硬件成本仍然高昂:最大规模的模型运行一个副本可能需要8张或16张 H100,之后还要处理采购、自动扩缩容和服务框架等决策。

  • 生产环境是“另一场比赛”。可用性必须从95%或99%继续提升,达到99.9%或99.999%的 SLA,同时具备容错、蓝绿部署更新、多区域复制、监控,以及支撑业务关键型应用所需的吞吐量。

  • GPU 成本使总拥有成本成为核心问题。Dev 提到更小的模型和 TurboLoRA,这是一种软件定义技术;他表示,该技术可以将吞吐量提升2倍。优化水平决定了每次昂贵部署能够产出多少有用结果。

  • Dev 认同,同一基础模型的推理——例如 DeepSeek——将越来越商品化。他给出的替代方向是“智能推理”:把部署与后训练连接起来,让模型随时间持续改进,将服务和定制整合进同一套系统,而不是在一个可互换的端点上竞争。

5. 每周突破要求计划保持适应性并坚持务实进取

  • Predibase 的规划会做到2026年,但 Dev 表示,AI 几乎“每周”都会带来一次预期层面的突破,因此 RFT 上线很容易被 OpenAI、Anthropic、Mistral、DeepSeek、Google、Amazon 或 Meta 抢走注意力。固定不变的北极星是专业化 AI 的调优与服务;具体技术和模态,包括视觉与语音,则保持适应性。

  • AGI“离我坦诚所见的世界还很远”,尽管 Dev 认为模型可能已经接近图灵测试意义上的定义。他关注的是能够在真实业务流程中带来生产力跃升的“实用型专业智能”,包括在 Marsh McLennan 这样的 Fortune 200 公司中的应用。他强调,这个行业连18个月后的情况都很难预测,更不用说5年、10年或20年后。

  • Dev 担心的不是有用的 ROI 是否存在:部署应用的 CIO 很少会问,每百万 token 支付50美分或1美元能否创造价值。真正的问题是,组织可能追逐“法国诗歌式”的应用或复杂的多 Agent 演示,错过当下影响最大的应用,并重新唤起2012年至2022年间 AI 在顶尖1%组织之外过度承诺所造成的失望。

  • 让他兴奋的是,“先做到完美再发布”正在被逆转。团队越来越多地发布“60%的方案”,用来测试产品市场匹配,并收集改进模型所需的数据;持续学习让一个起初并不完美的发布,从一种妥协变成开发策略的一部分。