先锋 趋势 方法 投研 作者
返回先锋
Div Garg
企业家 1 场深度对话收录

Div Garg

观点集合

与 MultiOn 联合创始人兼 CEO Div Garg 探索自主网络代理

  • 🗓️ 日期2025-05-17 | 🎙️ 节目:The Cognitive Revolution

MultiOn 以短流程、单网站任务切入,但代理必须通过执行数据、环境反馈和验证,才能在网站中稳定完成任务。微调基础模型叠加在线强化学习,可能将可靠性从90–95%推向接近100%;紧凑上下文与每步0.02–0.03美元的推理成本,则支撑产品经济性。跨网站组合、重复执行和安全控制,仍是从实用自动化走向可信通用代理的关键观察点。

查看访谈对话精读提要
  • MultiOn 的核心判断是,代理卡在推理和落地执行上,而不是对话流畅度上。 Div G 表示,GPT-4 能生成“看起来不错的内容”,但“真正的深度工作并不在那里”;网站是模型训练时没有学会表征的动态环境,因此长轨迹中的小错误会不断累积。讨论指向了聊天之外的关键层:执行数据、针对具体环境的反馈和验证。

  • 从90–95%的可靠性走向接近100%,路径是微调基础模型加在线强化学习,而不是从零开始做 RL。 Div G 认为,历史上的稀疏奖励 RL 之所以失败,是因为代理起步时几乎没有能力;如今的预训练模型提供了广泛知识,而监督微调可以先建立约90%的起点,让代理“在环境中探索和利用”。MultiOn 当时正在探索 DPO、模仿学习,以及针对可逆任务的实时互联网实验,同时明确避免“把互联网搞垮”。

  • 在通用代理出现前,商业化也可以启动,因为短流程、单网站任务已经构成可用的切入口。 Amazon 加购、DoorDash 和 Instacart 下单、NDA 以及会议邀请被列为当前强项;跨网站状态转移、重复任务和长任务仍然更难。当时 Div G 预计,MultiOn 很快就能选定一个任务,以“疯狂的准确率”完成,同时并行推进用户采用和研究。

  • MultiOn 在优化任务完成率的同时,也在优化产品经济性:速度至少达到人类的10倍、上下文足够紧凑、每步推理成本以美分计。 简单任务可能少于20步,研究任务约100步;Div G 将每步成本上限设在0.10美元左右,高效托管模型则接近0.02–0.03美元,100步任务的成本可能低于2–3美元。其平均推理输入“不超过5,000个token”,因此压缩、缓存和模型路由都是核心毛利杠杆。

  • 这套技术栈刻意保持模型无关,因为GPT-4虽然仍是最好的规划模型,却贵到无法作为大众消费产品的底座。 MultiOn 将微调后的开源模型与 GPT-4 混用,对替代模型进行“即插即用”式基准测试,并设计了即使 GPT-5 能力跃升也能延续的效率方案。Div G 认为,GPT-4 的优势来自“原料和厨师的质量”:经验丰富的研究人员、私有数据,以及庞大的人类标注流水线。

  • 路线图将从一次性动作推进到长任务、组合任务、重复执行,最终形成由并行代理构成的隐形层级。 用户可能只看到一个聊天界面,内部调度器则将工作分配给子代理,借鉴操作系统中的进程、优先级和故障处理;类似 Voyager 的技能库会缓存可复用流程。移动端访问和不保存用户密码的认证机制,目标是实现“ Siri 永远做不到的事”;API 则被定位为 Playwright 式自动化之上的自然语言抽象层。

  • 劳动力逻辑先是增强、后是替代,但信任可能成为 adoption 的硬约束。 Div G 预计,代理会像计算机取代打字机工作一样,消除“数字杂务”和“烂工作”,同时创造教学、编程和协调代理的新岗位;近期价值在于让用户从“从零到一”获得协助。Nathan 警告,恶意调用和能力跃升可能制造系统性风险;Div G 则建议加入内容审核、执行时验证、提示注入防护和快速行为补丁。

  • 🔗 原始收听与视频来源: 与 MultiOn 联合创始人兼 CEO Div Garg 探索自主网络代理

收听完整访谈 →