先锋 趋势 方法 投研 作者
我是这样用 RL + LLM 做 Agent 的|对谈 Pokee AI 创始人朱哲清 Bill
返回节目精读

我是这样用 RL + LLM 做 Agent 的|对谈 Pokee AI 创始人朱哲清 Bill

摘要

  • Bill 的核心判断是,RL 并非 LLM 的替代路线,而是叠加在 Transformer 之上的学习与规划方法。 LLM 提供语言、embedding 与对世界的基础理解,RL 则负责在未知路径中搜索并按长期 reward 决策;两者不是平行竞争,而是“可能是垂直型的”。这也是他认为 RL 能在大模型时代“焕发新生”的前提。
  • 复杂 Agent 的瓶颈不是理解指令,而是在指数增长的多步路径中找到可行解。 LLM 容易沿最高概率路径反复打转,RL 则能优先探索不确定性最高的方向,并依据未来期望值回退、换路;Bill 将其概括为“你需要的不是一个穷举的能力了,而是一个搜索的能力”。旅行规划是典型样本:走到第十一步才发现城市或时间冲突,系统必须知道该退回哪一步。
  • Pokee AI 押注的架构是“RL 做决策,LLM 做 I/O”,而非用更大的 LLM 包办一切。 用户需求先被抽象为目标、状态与 action,RL 决定 API 的调用顺序和参数,最终结果再由 LLM 转回人类可读形式;其 Shopify 公测系统据称以 1,500 万参数的 RL Agent 加不到 10B 的语言模型,在不足一个月内掌握几十个 API,且迁移到不同店铺不需特殊个性化训练。
  • 这条路线的商业杠杆来自可靠性与成本,而非模型规模叙事。 Bill 称团队一个月训练成本不到 1 万美元,RL 模型可以在 CPU 上运行;若用 GPT-4o 完成同类能力,价格可能是其“1,000 倍”。他的反问是:“能解决问题就好”,公司定位也不是大模型公司,而是“强推理、强规划型的工具使用 Agent”。
  • 电商只是通用 API Agent 的首个闭环场景,价值主张是替代碎片化插件和人工协调。 一个圣诞促销原本要销售、工程师与多个供应商分别修改折扣、运费、首页、搜索和推荐,成熟后的 Agent 只需一段文字即可调用底层 API 完成;Bill 称部分商家每季度为这类工作花费上百万美元。若产品兑现,他估计这类纯工程型东西“可能有 45% 到 60%”会失去价值。
  • Pokee 与 coding Agent 瞄准的是两种不同市场:前者组合既有业务能力,后者从零创造能力。 Bill 认为现实工作的大部分代码本就是组合 API,直接把一次 API call 视为 action,比逐 token 生成、编译和验证代码便宜得多;因此路线图是扩展到数千乃至上万个 API,再进入广告、旅行、教育、健身、法律和金融,而非先追逐全能编程。
  • 投资侧的关键挑战是公测中的准确性、可依赖性和单位经济,而不是“Agent 元年”的口号。 Bill 观察美国资金“不缺”,垂类 Agent 仍受关注,但大公司密集、标的混乱,science、supply chain 等较少拥挤的领域可能更受青睐。他不认同元年叙事,只判断下一年可能成为“真正由 Agent 来帮你采取措施并产生结果的一年”。

精读

1. RL 的复兴来自大模型补齐了真实世界表征

  • 朱哲清 Bill 在 Meta 工作七年半,前 3 年主要做 ML 落地,负责 Meta Ads B 端业务的 ML 推荐系统和第一批强化学习模型,包括广告折扣上的 RL 应用;后期负责 Applied Reinforcement Learning 团队,把强化学习落到广告推荐与基础设施。同时,他在 Stanford 用六年多攻读强化学习博士。Pokee AI 延续的正是这条技术线:用 RL 加 LLM 构造推理、规划和个性化更强的 Agent。

  • Bill 回顾,2016 年 AlphaGo 和游戏突破后,RL 长期受困于环境:游戏可以无限交互并立即拿到结果,真实世界却无法反复试错。到 2020 年左右,GPT、NLP 与 Decision Transformer 兴起,业界一度相信多步决策可以完全交给 Transformer 和模仿学习。

  • 转折在于,更复杂的推理与规划无法只靠既有数据和模仿完成,系统必须搜索训练集之外的路径。Bill 提到,最近做 OpenAI o3 和 o1 的一位研究者也曾说,RL 太 powerful,以至于他们最近思考问题的方式“全部都被 RL 化了”。

2. LLM 是世界接口,RL 才是学习和决策方式

  • Bill 反对把二者视为互斥架构:“RL 跟现在大模型这一系列的并不是一个平行的这种操作模式,它可能是垂直型的。”大模型可以与传统神经网络比较,而 RL 是训练与决策方式,完全可以借助 Transformer 的能力做更强规划。

  • 过去做开放世界 RL,团队要专门设计环境、action 和 representation;现在有了 LLM,很多东西可以用语言、embedding 等方式重构,LLM 相当于先提供对世界的基础理解,RL 再学习如何与这个世界交互,许多定制架构因而不再必要。

  • 这也解释了 Bill 此时创业:在 Meta,许多人替算法完成从具象业务到抽象 action 的转换;离开封闭系统后,这一步曾让 RL 无法落地。LLM 现在还能生成线下数据、评价 Agent 结果,终于把他设想多年的训练闭环补齐。

3. RL 的优势不是多试几次,而是知道该探索哪里

  • Pokee 设想的流程是:先把需求拆成目标、当前状态和可采取的措施,再由 RL 搜索 action 的顺序及组合;路径执行完毕后,结果交给语言模型重写成人能读懂的输出。决策空间已定义时直接调用 API,未定义时则由 LLM 辅助生成候选 action。

  • 数学推理属于后一类:模型生成一步、评价一步,卡住后再回退重走。曲凯追问,为什么不能让 LLM 自己“生成—验证—换路”?Bill 的回答是,语言模型受数据集框定,常常“只有一根筋”,而随机尝试的探索效率也很低。

  • Bill 用三家餐厅解释 uncertainty-driven exploration:一家每周吃五次,一家去过一次且很差,第三家从未去过。若目标是找出最喜欢的店,人会优先测试不确定性最大的第三家,而不是在三家中随机抽取;RL 要学习的正是这种探索次序。

  • 迷宫里,LLM 可能不断回到最高概率路径,却不知道路径之外还有多大不确定性。Bill 将更深层能力称为 counterfactual reasoning 或“平行宇宙的问题”:在“大世界”假说下,系统不必学会世界全部变化,只需根据过去走过的路径和当前状态,估计不同决策下的条件概率、成功概率和最终 reward。这不是在后台真的把每条路径试了一遍,而是计算条件概率下的 value。

4. 快慢思考可以分工,但业界尚未押注同一条路线

  • Rich Sutton 代表的另一条理论路线,是用 RL 与持续学习挑战 Transformer:数据不再是封闭数据集,而是不断流入的无限 stream。Bill 用弹簧解释 plasticity——模型被拉到最紧、趋于饱和后,再塞信息就可能“崩掉”;但他也承认,这条路线离落地更远。

  • Google、Meta 等讨论的快思考与慢思考更接近组合系统:快思考直接回答 Q&A,慢思考执行 chain of thought 或其他规划。Pokee 的选择更彻底——“所有的决策全是 RL 做的,外部所有的 I/O 接口是 LM”,像用多巴胺奖励训练决策区,再让知识区负责表达。

  • 这并非美国技术界共识。Bill 举例,李飞飞团队当时最新的 AI Agent 论文更多以模仿学习为核心;他预计,要等第一个可靠完成复杂多步决策的 Agent 出现,行业才可能“一拥而上”收敛到某条路线。

  • o1、o3 也说明架构与算法应分开看:Bill 认为它们没有改变 LLM 本身的架构,而是改变最后的训练算法;他还说,它们更多是在 inference 层面做了类似 RL 的优化。外界猜测 o1 使用 MCTS 反复走路、回退和换路,但代价是 inference 时间与价格都很高;world model 则试图提前预测每个 action 后的下一状态。Bill 还提到自己曾与 Yann LeCun 聊过两次,后者也想做长思考型、规划型系统,只是更多从世界模型角度出发。

5. RL 最适合总体优化、未知用户和相互依赖的 action

  • 在 Meta 广告竞价中,RL 优化的是公司整体营收期望,而不是保证每一次竞价都更好。局部 action 可能退步,但若若干用户或竞价取得 20%—30% 提升,总体广告效率仍可能显著上升;这正是期望值目标相对单点预测的价值。

  • Facebook Reels 的 bandit 项目提供了另一种适用条件:对于兴趣未知、很容易流失的新用户,探索型推荐据 Bill 所述带来了几十个百分点的 engagement 提升。普通推荐会持续押注已知高概率内容,却无法快速识别用户真正偏好。

  • 多步依赖同样关键:第一个时点花 10 美元,意味着第二个时点可能要少花;若先花 5 美元,后续预算就更宽裕。当前 action 会改变未来状态时,RL 才有明显优势;若只有一个 action、结果已知,本质只是预测问题,“RL 在里面不会有什么太大的作用”。

6. 真正的 Agent 从复杂旅行规划开始暴露难点

  • Bill 直言“Agent 这个概念有点被玩坏了”:买一张机票之类的单步任务,条件判断和传统工程就能完成,甚至不必使用 LLM。真正困难的是上海多个地点、再去杭州、两天内回北京这类跨城市、多约束的行程。

  • Pokee 最早向投资人展示的 demo,正是单一城市内跨多天、多酒店、多地点的规划。曲凯指出旅行 Agent 早已是黑客松常客;Bill 的解释是,短行程可以靠 LLM 拼出答案,但路径越长,晚期冲突越容易迫使系统回溯。

  • “每多一步,它的复杂度都是指数级上升的。”规划到第十一步才发现无法继续,难点不是再生成一个方案,而是判断应退回哪一层,以及改动哪一步对未来最有价值。

  • RL 会估算当前 action 对未来期望的影响:若三个候选措施中某一个让后续成功期望降为零,就应立即舍弃,而不是继续穷举。Bill 的结论很直接:“你需要的不是一个穷举的能力了,而是一个搜索的能力。”

7. Pokee 先让小模型掌握 Shopify 的底层 API

  • Pokee 的长期目标,是自主调用数千乃至上万个 API,完成复杂规划和推理。首个 beta 产品架在 Shopify 上;按 Bill 提供的数据,1,500 万参数的 RL Agent 配合不到 10B 的语言模型,在不足一个月内掌握了几十个 API,以及基础搜索、推荐和客服能力。

  • 这套 Agent 并不学习商店安装的上层插件,而是学习 Shopify 底层 API。API 被从具象变成抽象 action 后,Agent 再通过 self-play 学习“什么 action 得到什么结果、用户是否满意”,包括何时调用以及应传入哪些参数;具体训练细节 Bill 没有披露。

  • Bill 称这套训练与大模型本身的训练“没什么关系”,直接关系主要是 embedding layer:它把具象文字变成抽象 embedding。但 LLM 仍参与训练闭环,帮助判断执行结果好坏、生成需求,并提供高质量 embedding;真正决定 API 顺序、参数及多步组合的是 RL。

  • 对商家而言,产品像“招了一个网站负责人”:搜索、推荐、客服等能力共用同一数据与决策系统,除商品展示页外,多种 UI 可由 Agent 按模板生成。商家不必再安装几十个彼此割裂的插件,也不必雇工程师逐一维护。

8. 电商闭环的样板是把一场促销压缩成一句 prompt

  • 公测初期,Pokee 邀请 50 个电商商家安装,并把免费试用期从 14 天延长到 30 天换取反馈。待上线能力还包括商户与消费者通过 Agent 议价、自动创建折扣,以及用 prompt 同时改变全站推荐与搜索策略。

  • Bill 设想的成熟用例是圣诞促销:给相关商品打折,修改运费和运输时间,再将首页、搜索和推荐统一切换为圣诞主题。今天这些动作分别落在销售、工程师、推荐供应商和数据库操作上;未来只需用文字指定商品、promotion code 与排序倾向。

  • 曲凯补充,老客营销邮件也可成为同一流程中的 action。Bill 称其接触的一些电商每季度为类似运营与工程工作支出上百万美元;若 Agent 成熟,原本跨团队、跨供应商的流程可能在“五分钟之内就搞定”。

9. API Agent 与 coding Agent 分属业务组合和从零创造

  • Bill 将 Pokee 与 Devin 类 coding Agent 划出清晰边界:Pokee 在已有业务能力之上排列组合,解决客户的具体问题;coding Agent 则面对“根本没有这个业务”的场景,试图用 20 个开发者替代原本需要的 20 名员工,从零搭出完整系统。

  • 他观察,大厂工程师写的一百行代码,大部分也在组合既有 API。若 Agent 已知道怎样跨 API 完成多步决策,它就覆盖了大量现实任务;只有世界上不存在所需能力时,才必须逐 token 写代码、编译、验证并建立新代码库。

  • 直接调用 API 的决策成本也更低:一次 action 得到一个结果即可;生成代码则要求“每个 token 都需要保证精确”。因此 Pokee 的重点是把 API 调用作为 action,完成已有业务能力的多步组合,而不是从零生成完整代码。

  • 长期路线包括向非 Shopify 商家开放产品、折扣等 API,并进入广告、旅行、教育、健身,再延伸到法律和金融。公司间也可能由 Agent 直接交接库存和订单;若对方只有电话或邮件,Agent 可以调用相应服务,但没有标准接口时仍难形成可靠闭环。

10. 小模型经济性是护城河假设,落地可靠性才是验证点

  • Bill 称团队迄今一个月训练成本不到 1 万美元,RL 模型可以运行在 CPU 上。他不接受“伪大模型”的质疑:“不一定非要把一个榔头造得超大,最后变成核武器。”Pokee 从不自称大模型公司,而是 Agent 公司。

  • 早期规划 demo 使用 1,000 万参数的 RL 模型加 Llama 8B;按 Bill 的测试,在单一城市规划上超过了当时的 GPT-4。对垂类竞争者,他认为即使对方压缩 chain of thought 和模型体积,仍需承担基础 LLM 成本;若直接依赖 GPT-4o,完成同类能力可能是 Pokee 的“1,000 倍”价格。

  • 若通用 Agent 成型,Bill 判断 Shopify 数千个插件中,纯工程类的东西“可能有 45% 到 60%”会被替代,主要是只在底层 API 上增加工程封装的产品;非工程型服务仍会存在。下一阶段目标则是不需特殊 prompting,就能理解需求并精准调用数千、上万个 API。

  • 对市场,他的判断是“钱是不缺的”:美国投资人仍关注垂类 Agent,AI 投资项目通常以几千万、上亿美元规模快速出现,但准确性、可依赖性与盈利模式仍是共同挑战。与其宣布又一个“Agent 元年”,Bill 更愿意把下一年定义为大量公司开始真正让 Agent “采取措施并产生结果”的一年。