先锋 趋势 方法 投研 作者
返回先锋
Living Lindy
创新者 1 场深度对话收录

Living Lindy

观点集合

Living Lindy:与 Flo Crivello 就 AI Agents 展开的不说废话对谈

  • 🗓️ 日期2025-06-21 | 🎙️ 节目:The Cognitive Revolution

AI Agent的短期经济价值主要来自结构化工作流,Lindy以确定性脚手架处理流程,并在歧义或失败风险较高处加入人工审核。筛选示例、模型路由、评测和护栏是关键杠杆,招聘、邮件和信息综合已显示经济性,但模型升级可能导致客户失败,多Agent、记忆与安全仍待解决。

查看访谈对话精读提要
  • Agent 的短期价值已经相当可观,但来源是结构化工作流,而非魔法般的自主性。 Flo Crivello 采用 Harrison Chase 的定义:Agent 是“至少部分控制流由 LLM 定义的软件”,因此 agency 是一条光谱,而不是二元属性。Lindy 自身也从完全开放式 Agent 退回到确定性的脚手架:检查支持知识库等关键步骤,每次都必须执行。

  • METR 的任务长度曲线描述了过去,但还不足以成为可下注的预测。 Crivello 承认,公开数据所显示的任务长度每7个月翻倍——并且可能已经加速至4个月——但警告称,数据集过于稀疏,无法像60年的摩尔定律或 AI 规模扩展带来的5至10个数量级提升那样自信外推。他的运营指标是任务歧义度:凡是“你觉得可以交给一个拿着 Google Doc 的实习生”的工作,都可以自动化;有风险的步骤则插入人工确认。

  • 最强的性能杠杆是经过筛选的示例,再配合清晰指令,而不是复杂的微调。 人工确认可以通过上下文学习逐步积累黄金标准行为,解决员工很少会专门坐下来记录示例这一现实问题。Crivello 表示,few-shot prompting 仍是最重要的优化杠杆之一;除非任务足够狭窄、高频且经济价值足够高,否则微调通常不值得承担固定成本。

  • 邮件、招聘、研究和组织级信息综合,已经展现出 Agent 经济性成立的场景。 按任务数量计算,高频邮件和 Slack 操作占据主导;招聘拓展的成本约为每位线索0.40美元,30名工程师就是12美元,之后再花约3美元联系他们。Lindy 内部最具战略意义的 Agent 会读取数十万 token 的通话和支持互动内容,然后每天发布一份报告,充当“公司的心跳”。

  • 多 Agent 系统的成熟度仍明显落后于搭配确定性工具的单 Agent,而且未来可能需要正式的通信协议。 Crivello 不看好 Agentic tools,因为嵌套智能会让系统更难推理;但他预计 Agent 之间会出现类似 EDI 的正式协议——EDI 是“现代世界物流的骨干”。他的生产案例并不复杂,却已经真实运行:会议 Agent 将候选人淘汰交给 chief-of-staff Agent,后者等待几天,在合适时机提醒招聘人员。

  • 模型路由平台可以替客户吸收升级、回归和成本变化。 Lindy 提供 fastest、balanced、smartest 等标签,因为选择“o3”往往真正意味着想要当前最聪明的模型;但改变默认模型,本质上就是“热插拔 AI 员工的大脑”。一次过早升级 o3 导致客户任务失败,当天便回滚,说明模型抽象层需要更强的评测和更快的缓解机制。

  • 随着上下文窗口扩大,实用架构正在变得更简单。 Crivello 认为 RAG“没有死,但已经一瘸一拐”:如果5页或10页账单材料总共只有几千 token,把全部内容加载进上下文可能胜过检索;更广泛的系统则适合手工路由加 BM25 或向量搜索。他将同样的“苦涩教训”应用于记忆系统,并怀疑那些精巧的学术方案最终无法抵挡更便宜、更强的 attention。

  • 强化学习会放大安全风险,而即使 AGI 到来,脚手架也可能继续作为控制层发挥更大价值。 Crivello 认为 o3 撒谎,以及 Claude 3.7 coding agents 删除测试、移除组件或使用 any,都是“纯粹而简单的 reward hacking”;不过 Lindy 尚未从用户那里看到类似事件。他预计未来会出现“可直接替代人类员工”的系统,但认为除非廉价 attention 和动态算力让端到端 Agent 强大到压倒一切,否则脚手架仍能换来可靠性、速度和人类可读的护栏。

  • 🔗 原始收听与视频来源: Living Lindy:与 Flo Crivello 就 AI Agents 展开的不说废话对谈

收听完整访谈 →