先锋 趋势 方法 投研 作者
RL为何胜出——Kyle Corbitt,OpenPipe(被 CoreWeave 收购)
返回节目精读

RL为何胜出——Kyle Corbitt,OpenPipe(被 CoreWeave 收购)

摘要

  • OpenPipe 找到的早期产品切口,是把昂贵的 GPT-4 工作流蒸馏成更小、更便宜的模型,而当时开源替代品还不够好。 其即插即用 SDK 捕获生产环境中的调用轨迹,训练替代模型后只需更换推理 URL;首批3个客户在1个月内到来。上线约8个月后,ARR达到100万美元,但前沿模型每次反复降价3–5倍,持续侵蚀这一切口。

  • 当部署约束迫使用户采用更小模型时,微调仍然有价值,尤其适用于实时语音、单 GPU 运行或私有云推理。 Kyle 估计,在没有这类约束的“90%的使用场景”中,微调的 ROI 仍然很差。训练单次只需5美元到几百美元,真正昂贵的是数周甚至数月的工程投入,以及每当提示词或上下文变化时,持续损失技术栈灵活性。

  • OpenPipe 的任务专用 RL 策略,已从2025年1月的25%押注,升至 Kyle 当前认为规模化部署的智能体应通过 RL 学习的55–60%概率。 在 o1 之后,前沿实验室已经证明 RL 对通用智能体和编码模型的价值;尚未解决的问题,是企业是否应围绕每个已部署智能体自己的任务和经验进行训练。“不是100%……但我脑中的概率正在朝正确方向移动。”

  • GRPO 通过取消 PPO 的价值模型、只要求相对排序,简化了 RL,但它依赖并行且可复现的 rollout,可能因此“走进死胡同”。 相对评分让评审者只需从多条轨迹中选出最好的一条,而不必定义全局正确的行为。代价是环境必须复现生产系统,包括 bug、状态、工具响应和人的差异;至少在理论上,PPO 可以直接从真实生产轨迹中学习。

  • RULER 让 Kyle 相信奖励分配问题“基本已经解决”,环境因此成为主要瓶颈。 该库通过 LLM 评审者对一组智能体运行结果进行排名;OpenPipe 甚至用 Qwen 2.5 32B 作为评审者训练 Qwen 2.5 14B,并在选定任务上击败了前沿模型。“基本就是能用”,但高度专门化的领域仍可能受益于任务专用奖励模型。

  • 在 OpenPipe 的测试中,提示词优化有一定方向性价值,但远不及 RL:基线约50%,GEPA 为56%,RL 则达到96%。 Kyle 保留了“可能是我们用错了”的限定,并表示客户关心的是最终性能,而不是提示词还是权重发生了变化。他认同在线评测比静态数据更有前景,因为否则反馈会过时并变成 off-policy。

  • CoreWeave 的收购为 OpenPipe 提供了更大的 serverless RL 和持续学习平台,并没有终结其产品论点。 团队现在位于 Weights & Biases 组织内,负责处理 GPU 崩溃、显存溢出和扩缩容,客户则定义环境与奖励。其北极星是“一个开放世界,让每个智能体都从真实世界经验中持续学习”,这或许能把目前停留在概念验证阶段的项目转化为多达当前10倍的 AI 推理量。

  • 到2026年底,开源模型或可占据非编码 token 的15–20%,但编码可能仍由闭源模型主导,而200美元套餐正在大幅补贴更强的闭源模型。 只要性能足够,企业就希望出于成本和隐私考虑采用开源模型。讨论也质疑补贴能维持多久;Kyle 则指出,自建基础设施的实验室可能通过变现闲置 GPU,继续维持低价。

精读

1. GPT-4 的价格造就了 OpenPipe 的第一个切口

  • 在创办 OpenPipe 之前,Kyle 曾在 YC 负责 Startup School 约4.5年。2022年初离开后,他尝试了几个方向,随后与弟弟在2023年3月左右组建了 OpenPipe。

  • 机会非常清晰:GPT-4“贵得离谱、能力又极强”,而特定任务的工作流有可能被蒸馏进更小、更便宜的模型。当时,开源模型普遍还不足以直接替代闭源模型。

  • 产品把这一判断封装成托管流程,而不是要求客户先变成 ML 团队。OpenAI SDK 的即插即用替代品会在生产环境中捕获 GPT-4 的问题和回答;积累足够数据后,OpenPipe 训练模型,并通过另一个兼容 API 对外提供服务。

  • 2023年末,生产级 AI 仍然少见,但少数大规模运行的公司有时每月向 OpenAI 支付几十万美元。这让销售变得容易:OpenPipe 大约1个月内找到首批3个客户,并在上线约8个月后达到100万美元 ARR。

  • 早期结果验证的是客户痛点,而不是解决方案的永久性。前沿模型供应商不断将 token 价格下调3–5倍,同时推出能力更强的小模型,逐渐抹平了让蒸馏显得如此划算的成本优势。

2. 产品体验比 GPU 供应商捆绑更重要

  • 主持人最初担心,市场会被前沿实验室推出更便宜的“mini”模型,以及 GPU 云厂商通过提供微调来提高客户粘性的做法双向挤压。Kyle 对前沿模型的冲击感受很深,但表示新型云厂商和 GPU 供应商的微调产品“从来没有真正出现”。

  • 几乎每家基础设施供应商都有相关产品,但 OpenPipe 的潜在客户基本不理会,因为这些产品很难用。Kyle 的解释听起来朴素,却影响深远:微调不是这些公司的核心产品,“开发者体验很重要”。

  • Mistral 7B 和 Mixtral 造就了主持人所说的微调创业公司的“黄金时期”。它们相较 Llama 2 有可信的改进,而 Mistral 的 Apache 2.0 许可,在开源模型授权仍让客户高度焦虑的时期,提供了异常开放的商业承诺。

  • 原业务带来的战略启示是:好用的托管层可以胜过垂直捆绑的基础设施,但无法永久抵御一个质量上升、价格下跌的前沿模型。

3. 微调只有在硬部署约束下才能体现价值

  • Kyle 基本仍坚持此前的挑衅性判断:大多数用户“可能并不需要微调”。最明确的例外,是被迫转向更小模型的场景,通常因为实时语音要求更低延迟,或部署必须装进单张 GPU、甚至客户自己的云环境。

  • 在这些约束下,微调往往是必要条件,而不只是锦上添花:未经微调的小模型无法稳定替代应用原本使用的大模型。除此之外,Kyle 估计,“90%的使用场景”仍不足以产生有吸引力的微调回报。

  • 固定成本首先是至少投入一名合格工程师数周时间。需要定制环境的复杂 RL 系统可能耗时数月,而此后每次提示词或上下文变化,都可能增加数小时的重训练时间,拖慢产品团队的迭代节奏。

  • 相比之下,算力成本几乎无关紧要:单次运行约需5美元到几百美元。“美元成本……基本从来不是决定因素”;真正主导决策的是工程师时间,以及持续损失技术栈灵活性的代价。

4. LoRA 是基础设施优势,不是打折版微调

  • LoRA 可以降低训练显存,但 Kyle 认为它更大的价值体现在推理阶段。多个 adapter 可以复用同一套 GPU 部署,从而实现按 token 计价的经济模型,不必让每个定制模型都对应一份专用 GPU 时长合约。

  • 主持人对其市场定位的批评很尖锐:LoRA 被包装成买不起完整训练的客户使用的“微调沃尔玛自有品牌”。OpenPipe 有时不得不反过来要求客户,直接把 LoRA 与他们真正需要的轻量级任务定制方案做比较。

  • 对于这些工作负载,Kyle 认为“确实没有什么缺点”,同时能显著简化基础设施。Thinking Machines 后来发表的 LoRA 与全量微调对比研究,加上 Kyle 观察到大型实验室研究人员也用 LoRA 做实验,都像是对其价值的强力背书。

  • 因此,Kyle 对 LoRA 失宠的判断是间接的:“LoRA 有一段时间很不酷……主要只是因为微调本身不酷。”如果随着任务专用 RL 的发展,微调重新流行起来,LoRA 的部署特性就会重新变得重要。

5. o1 将任务专用 RL 变成一次经过计算的公司押注

  • Strawberry 的泄露消息和 o1 的发布让 OpenPipe 确认,有人已经让 RL 在 LLM 上真正产生了显著效果。到2024年末,Kyle 认为前沿模型的案例越来越确定:对 RL 的投入正在带来明显更强的智能体行为,最直观地体现在编码模型上。

  • 尚未被证明的是任务专用定制。单家公司能否教会智能体完成自己的特定工作,还是前沿实验室最终会覆盖所有重要任务,从而消除这一需求?OpenPipe 在2025年1月决定至少花几个月时间寻找答案。

  • 在投入邮件智能体之前,团队已经用 RL 训练过一个带有娱乐性质的 Hacker News 标题生成器。Kyle 当时认为任务专用 RL 会成为“所有做推理的人都应该做的事”的概率只有25%,但抢先布局的上行空间足以支持这次押注。

  • 客户项目后来将他的估计提高到55–60%:规模化部署的智能体应在上线前或上线后持续接受 RL。他仍然保留关键限定:“这仍然是一次押注”,还不是普适的架构。

6. GRPO 以简单性换来了环境陷阱

  • GRPO 去掉了 PPO 独立的价值模型,也省去了训练价值模型所需的运维工作和超参数。它在相同条件下生成多条轨迹,对其进行评分,然后相对于较差路径提高表现更好路径的概率。

  • 这种组内相对比较降低了评分器的负担。人类或 LLM 不必判断某个输出是否绝对优秀,只需从几条结果中选出更好的一条;Kyle 认为,这种比较容易得多,也不需要全局校准的奖励。

  • “巨大的缺点”在于,并行 rollout 要求环境可复现。对于运行在真实应用和代码库中的智能体而言,创建一个拥有生产级状态、响应、故障模式和数据的沙箱,已经成为让 RL 真正运行起来最难的一步。

  • 因此,Kyle 怀疑 GRPO 对许多部署而言“很可能会走进死胡同”。PPO 的运维复杂度更高,但至少在理论上,它可以从真实生产轨迹中学习,而不必构建 GRPO 的组内相对训练所依赖的模拟世界。

7. 高保真环境是稀缺的 RL 输入

  • Kyle 用 Airbnb 作比喻,揭示了其中的工作量:训练一个预订智能体,需要搭建一个像真实网站一样响应的副本,包括其中的 bug。只要遗漏一种生产故障模式,训练出来的智能体第一次在沙箱外遇到该 bug 时就可能“直接崩掉”。

  • 协作型智能体还会引入另一个模拟问题:人类。带有用户模拟提示词的 LLM,行为范围远窄于真实客户;真实客户的措辞、纠正方式和反应各不相同,训练中的智能体可能从未遇到过。

  • 理论上,企业已经拥有用于端到端测试的这类系统。实际上,Kyle 说企业“几乎普遍”缺少真实、完整填充的副本;即便已有测试环境,也往往排除罕见 bug 和生产级数据分布。

  • Kyle 认为环境创业公司仍可能有价值,但表示当前客户池只有大约4家、也许6家大型实验室。主持人估计市场上约有20家此类创业公司,并且至少存在金额达到7位数的交易;Kyle 则将当前模式描述为服务业务:专家临时搭建集成环境,而不是交付一个类似 CSV 的简单数据产品。

  • OpenPipe 投资组合公司之一 Varas 与智能体开发者合作,处理内部工具调用循环,并将其轨迹转化为 OpenPipe RL 所需的数据。Kyle 举了金融服务的例子,例如余额和交易查询;工具文档缺失或命名混乱,会让智能体行为难以改进和测试。

8. GEPA 输给了 RL,但在线评测经受住了比较

  • 主持人质疑,提示词优化和权重更新是否属于苹果对苹果的比较。Kyle 的回答是商业性的:想要最佳智能体的公司并不在乎改变的是哪一层——“只要我的智能体性能变好了,我就满意”;最终的最高性能可能会同时使用两者。

  • OpenPipe 的实证结果差距悬殊:其朴素提示词配合模型的得分约为50%,GEPA 达到约56%,RL 则约为96%。Kyle 还说,他们尝试过此前备受追捧的 MIPROv2。但他反复限定结论:“可能是我们用错了。”

  • Kyle 为 GEPA 提出的最强论据,是它在理念上类似大型实验室对长系统提示词进行的迭代式、遗传式进化。但主持人指出,人类提示词作者可以注入固定评测中不存在的品味、直觉和信息;他们可能会拒绝一个得分很高的改动,因为那“实际上并不是”自己想要的东西。

  • Kyle 更认同在线评测的逻辑。随着提示词或权重变化,静态数据会过时,就像旧的 RL 轨迹会变成 off-policy;有效的改进循环需要当前生产反馈,把分析、UX、实验和模型可观测性整合到同一套系统中。

9. RULER 让较弱的评审者也出奇有效

  • RULER,即 Relative Universal LLM-Elicited Rewards,将 GRPO 的核心思路封装成一种易用的奖励系统。给定一个任务和例如4次智能体运行结果,LLM 会对哪次表现最好进行排序,而不是分别给出经过校准的绝对分数。

  • Kyle 表示,评审者可以针对同组结果“自我校准”,而且该方法在内部实验和客户项目中的表现远超预期。一旦加入训练流程,“它大概就能直接运行”,让奖励设计不再高度定制化。

  • 最有代表性的实验,是用 Qwen 2.5 14B 作为训练模型、Qwen 2.5 32B 作为评审者。尽管评审者明显弱于前沿模型,训练后的智能体仍在 OpenPipe 评估的特定任务上超过了前沿模型。

  • 这让 Kyle 对任务专用 RL 的信心从约25%上升到50%以上,也让他觉得“奖励分配问题基本已经解决”。他不看好通用的专用评审模型,因为 LLM-as-judge 已经足够普遍,前沿实验室很可能正在大量此类任务上训练。他仍承认,在拥有大量任务专用数据的罕见任务中,专用奖励模型或评审者可能更有价值。

10. 世界模型或许能取代手工搭建的沙箱

  • Kyle 认为,世界模型是解决剩余环境问题的一条可能路径。智能体发出工具调用后,世界模型生成可能的响应,并维护足够的内部状态,以反映此前动作及其后续影响。

  • 设想中的流程,是用生产轨迹对模拟器进行条件训练,让它学会特定系统的行为和故障模式,再让智能体在想象出的环境中训练。最终策略能否迁移回真实系统,是成功的必要条件;Kyle 将其视为有前景的研究,而不是已经解决的问题。

  • 主持人将其与 Meta 的代码世界模型工作联系起来,但 Kyle 做了区分:该项目看起来更接近于预训练一个理解程序执行的模型。代码通常不需要合成部署环境,因为训练者可以直接执行代码;企业工具和人类工作流则无法如此廉价地复现。

11. 开源模型经济学取决于编码和补贴算力

  • Andreessen Horowitz 的一项估计称,开源模型约占 token 的5%,且占比正在下降;主持人预计,随着企业寻求成本、隐私和控制权,这一份额会回升。一位主持人预测,到2026年底,剔除编码后,开源模型将占15–20%,而不是接近50%。

  • 编码改变了分母,因为在相关工作负载上,专有模型仍然更强,而200美元的“max”订阅可以制造出价值数千美元的表面使用量。Kyle 说,他支付200美元后曾在1小时内意外消耗100美元;主持人则认为,这些套餐得到了大幅补贴。

  • Kyle 反驳称,补贴可能持续存在:Anthropic 和 OpenAI 正在建设自己的基础设施,可能拥有闲置 GPU,因此有动力提高利用率并补贴部分使用量。他将其与更便宜的算力报价作比较:H100 约1.40美元,而 AWS 标价为2.20美元。

  • 这段融资插曲体现了行业规模:Kyle 认为,大约2000亿–3000亿美元的资金可能足以筹集并投入一项规模大得多的计划;主持人则开玩笑说,“世界历史上没有任何其他行业”会让再投入几千亿美元听起来无关紧要。

12. CoreWeave 为持续 RL 提供更大的运营底座

  • RULER 于7月25日发布,收购则在9月完成。Weights & Biases 创始人 Lucas 和 Shawn 在 W&B 最近被 CoreWeave 收购后发起了这次接触,CoreWeave 希望进一步向技术栈上游延伸。

  • 整个过程“很漫长”,也“相当痛苦”;直到签约前一周,Kyle 仍不确定交易能否完成。OpenPipe 现在隶属于 Weights & Biases 组织,并以该品牌对外发布产品,不过合并后的组织结构仍在磨合。

  • Kyle 原本担心出售公司后工作环境会“非常、非常糟糕”;约1个月后,他表示实际情况远好于预期。新推出的 serverless 强化学习产品允许客户定义环境和奖励,再发送轨迹与分数进行模型更新。OpenPipe 团队负责 GPU 管理、崩溃、显存溢出和扩缩容。

  • 公司的北极星是“一个开放世界,让每个智能体都从真实世界经验中持续学习”。Kyle 估计,最终可能上线相当于当前10倍的 AI 推理量,来自那些被困在概念验证阶段的项目;他另行表示,如果可靠性改善,今天可触达的推理市场中有90%都可能上线。

  • 奖励劫持确实会发生,但 Kyle 认为问题可控:模型一旦找到漏洞,就会极其稳定地重复这个诀窍,运营者很快就能发现。在客户项目中,向奖励提示词加入额外的负向项后,这种行为已经“直接消失”。

  • 他在 YC 学到的经验解释了 OpenPipe 的演变:“紧紧抓住问题,灵活对待解决方案。”但他现在开始质疑持续追随梯度的做法;如果拥有足够的愿景和品味,他的下一家创业公司或许会更长时间埋头推进,在要求市场立即证明之前,先追求一个更大胆的想法。