先锋 趋势 方法 投研 作者
Vol.56 没有人知道到底什么TM是Agent…
返回节目精读

Vol.56 没有人知道到底什么TM是Agent…

摘要

  • Agent的行业热度尚未转化为真实需求,供需两端都在对“只有概念、没有方案”投票。 群响一万多会员、往届单场常有2,000—3,000人参会,AI创业课首日却仅报900人;庄明浩援引的美国To B调研则显示,94%的企业不满意其AI vendor。“大家都知道AI是一个宝藏”,但至今多数服务仍停留在“收割焦虑和讲点逻辑”。

  • 从L1到L2已形成“通用、少控制、只奖励结果”的路径共识,但这套法则能否把行业带到L3仍是最大悬念。 OpenAI路径中的L1聊天机器人、L2推理者、L3 Agent、L4创新者、L5组织者,头部公司正处在从L2向L3走的节点;2025年从企业尝试走向真正落地、由Agent承接答案的时间点共识,庄明浩认为仍有较多一厢情愿成分。DeepSeek R1等强化学习实践支持“更少的控制,更多的智能”,却不等于Agent也能摆脱边界、工作流与人为结构。

  • 应用层最大的投资风险,仍是模型一次升级就吞掉创业公司多年构建的产品能力。 归藏认为,GPT-4o图像生成几乎可以用自然语言覆盖复杂Stable Diffusion工作流,再次提示“能力没有收敛之前,谨慎做应用”;但产品并非没有价值,Manus给出的“看见”范式——规划、to-do list、逐步执行、归纳与完整交付——正在成为L3的人机交互语言。

  • Agent尚无统一定义,但行业正在收敛到记忆、规划、工具使用和行为四项特征。 真正的跃迁不是更会说,而是“从语言到行为”:调用现有工具已足以完成大多数通用任务,难点转向上下文、权限、数据与安全架构,以及如何把搜索、浏览器、商业软件和代码执行串成端到端结果。Deep Search与Deep Research的底层差异,对用户而言最终都要让位于结果质量。

  • 机会结构已开始分层:通用Agent与平台生态看起来偏向巨头,早期投资相对集中于专业Agent;基础设施虽不完善,却因此涌现大量项目。 Browser Use在3月22日融资1,700万美元,Browserbase成为Enterprise Tech 30早期榜首,A1Base甚至只为Agent提供Email、WhatsApp和电话号码身份;“产业链分工太细了”本身,正是Infra层尚未定型的机会信号。

  • “边界不清楚的叫Agent,边界清楚的就不叫了”,意味着概念估值最终必须让位于具体业务。 按这一暴论,AI搜索、AI Coding、Deep Research一旦明确交付边界,可能就不再强调Agent标签;所谓微信Agent虽有小程序作为“手”的潜在优势,却受隐私、权限与微信谨慎节奏约束。“上一次遇到包容这么多东西的概念还是Metaverse呢。”

  • 庄明浩认为,Agent商业化未必会长期停在每月20美元,任务级成本、ARR与自动化价值将更早接受市场检验。 Manus按约1美元兑100积分收费:15分钟的数据分析约2美元、25分钟网页开发约3.6美元、80分钟应用开发约9美元,用户必须判断“什么任务值得你花几美金去执行”;在推理仍贵、复杂环境不可靠、用户仍需盯守的现实下,普通白领工作自动化可能比“诺贝尔水平”的科研推理更有利可图。

精读

1. 热度没有转化为需求,概念先于解决方案爆炸

  • 庄明浩用群响的报名反差开场:一万多付费会员、往届大课通常到场2,000—3,000人,AI创业课在全力推荐后首日却只有900人,远低于原先“第一天三千人就满了”的预期。

  • 刘思毅给出的解释被完整保留:“大家都知道AI是一个宝藏”,但创业者同样清楚,除了焦虑营销和逻辑讲解,市场仍没有探索出一套真正可服务他们的解决方案。

  • 另一侧也不乐观:庄明浩援引美国To B企业调研称,回看2024年,94%的企业不满意其AI vendor,满意者只有6%。与此同时,他提到市面上应该已经出现《Manus极简入门》,形成一种荒诞对照。

  • 智谱又发布了AutoGLM沉思,一个类似Deep Research的AI Agent;Agent、Deep Research、AutoGLM、GLM、沉思层层叠加,让非行业用户无从理解,也暴露技术、产品与市场团队之间的巨大语言裂缝。

2. L1到L2的成功法则,未必能直接复制到L3

  • OpenAI描述的AGI路径是L1聊天机器人、L2推理者、L3 Agent、L4创新者、L5组织者;庄明浩判断,全球头部公司大体处在从L2向L3移动的节点。

  • L1的突破是“通用”:从规则、机器学习、神经网络到Transformer,再到GPT-3和ChatGPT,模型不再依靠单一领域数据集只完成一个任务。上一代AI最终扎堆视觉、摄像头与安防,恰是场景被限定后的结果。

  • L2则来自更复杂的输入、思维链与后训练。行业曾争论应奖励每一步过程还是最终结果,后来的实践指向强化学习只激励结果、不强加结构;DeepSeek以V3为基础得到R1-Zero,再通过冷启动数据等后训练改善可用性,并把方法复现到Llama和Qwen。

  • 因而已有两条共识:“通用”,以及“更少的控制,更多的智能”。庄明浩真正追问的是:L3也应不限定场景、不加工作流,只依靠结果激励吗?节目没有假装给出确定答案。

  • 2025年被寄望于让企业从AI尝试走向真正落地,并由Agent承接这一答案;但庄明浩认为,这种时间点上的收敛共识仍有较多一厢情愿成分,场景与垂类同样存在空间。

3. 模型升级仍在吞掉应用层护城河

  • 过去两年主线仍是更多资本、基础设施和训练换取更强模型。DeepSeek爆火时,产品形式并无根本创新,核心仍是“智能加开源”;这让庄明浩继续怀疑,产品与商业模式创新是否始终敌不过智能本身。

  • GPT-4o图像能力引爆吉卜力风格内容。归藏认为,它几乎可以通过自然语言完成复杂Stable Diffusion图像生成工作流的各种玩法;有人前一天还在学习Stable Diffusion教程,第二天便发现“全部都白看了”。

  • 庄明浩引用雨森关于Perplexity的例子:技术人员可能认为它几天就能复现,但如果早期能投几亿美元,如今Perplexity已经是一家100多亿美元的公司;它能否干掉Google另说,早期投资回报本身已经成立。

  • 但“套壳”也低估了工程难度。即使只在模型上叠一层薄产品,从需求定义到可靠交付仍很复杂;智谱AutoGLM沉思的实现并不理想,说明“大家知道该怎么做”与真正做出好产品是两回事。

4. 产品趋势开始抬头,“看见”成为Agent的交互语法

  • ChatGPT的魔法时刻,是用户看见机器吐字;DeepSeek R1的魔法时刻,是看见模型思考。Manus给出的L3定义把这一逻辑推进到:用户要看见规划、to-do list、网页与代码操作、资料整理、归纳,以及最终网页或报告的完整交付。

  • 秘塔搜索把长答案转成互动网页时,特意显示滚动的HTML代码和0%到100%的进度条。生成本身并不神秘,但产品选择让用户“看见过程”,从而把等待转成可感知的劳动。

  • 戈飞提出的“4-2-4”原则说明,技术实现只是中间的“2”;前面的需求和产品边界、后面的运营推广,各占更重的“4”。这也是开源方案与用户可用产品之间的真实距离。

  • Enterprise Tech 30提供了弱但明确的旁证:AI-native公司占比从2019—2020年的0、2021年的3%,升至2023年33%、2024年40%、2025年50%;非技术导向PLG则由此前约15%—20%升至25%,产品、销售与品牌叙事正在小幅回归。

5. “Agent”仍是盲人摸象,工作流既是补丁也是边界

  • 游戏早已有脚本、机器学习和自动行为:足球游戏中不受玩家控制的队友与对手,乃至《吃豆人》中规则各异的四个敌人,都被庄明浩拿来追问是否算Agent。今天争论的其实是大语言模型这一代Agent,而非Agent第一次出现。

  • 庄明浩回看2023年至2024年初的YC项目,Agent当时已是第七大分类;项目分别依靠录屏、拖拽、自然语言、RPA、逻辑树和工作流做代理,彼此差异却很小,“又一个共识Agent”甚至可能只是中间态。

  • 当时的逻辑是“模型能力不够,workflow来凑”,但工作流无法穷举全部情况,只能限定场景与边界。行业于是反复走过简单、复杂、再简单、再复杂:自然语言之后出现提示词与思维链,推理增强后又为Agent堆上工作流。

  • GPT-4o用自然语言覆盖复杂图像工作流,再次提示人类可能被路径依赖带进“弯路”。若L3延续通用与少控制的方向,它最终或许也不应依赖被人工穷举的workflow。

6. 收敛的不是定义,而是记忆、规划、工具与行为

  • 庄明浩把当前共识压缩为四个特征:记忆、规划、使用工具、产生行为。记忆仍受上下文窗口制约,Manus常见的上下文超限报错说明,这个基础问题并未解决。

  • 规划曾依靠工作流等“战术上的努力”,推理模型出现后才显得可行;工具侧则不必急着发明新工具,现有生态已经能完成大多数通用任务,真正问题是怎样可靠调用。

  • 工具调用继续带来访问权限、数据架构和安全架构问题。所谓端到端训练并未消除边界,而是与必要限制、强化学习、推理和外部系统连接成新的工程整体。

  • 他区分了Deep Search与Deep Research:前者基础是搜索,后者被描述为端到端训练的模型;但用户并不关心底层是RAG还是端到端,只关心结果质量。

  • 游戏落地不理想的解释很直接:“这一波的模型叫大语言模型,语言;可是游戏里需要的是行为。”从Computer Use到OpenAI Operator,头部厂商都在尝试让语言模型真正行动,这是L2走向L3的核心。

7. 通用机会归巨头,早期资金偏向专业Agent,基建项目众多

  • CB Insights的Agent地图分为三层:Infra;软件开发、数据分析、安全、销售、HR、Marketing等水平工作层;以及法律、游戏、健康等垂直行业层。这个分层也对应不同资本可进入的机会。

  • 通用模型厂商与大型科技公司不仅做Agent,也会做开发工具和平台,争夺生态;通用Agent因此更像巨头机会。早期投资则相对集中在专业Agent,垂直行业能否走出类似美国SaaS的格局仍有待验证,国内此前SaaS投资项目的教训也无法回避。

  • Infra不完善,反而催生最多项目:开发平台、Multi-Agent、自动化执行、Web测试、数据分析、支付、记忆与搜索服务。MCP之所以突然升温,正因为它试图解决“现有工具如何被调用”;OpenAI也发布了兼容MCP的Agents SDK。

  • 具体融资显示资本已下注:Browser Use在3月22日融资1,700万美元;Browserbase登上Enterprise Tech 30早期公司榜首;A1Base只为Agent提供WhatsApp、Email和电话号码,让它拥有注册、收验证码和进入服务所需的“身份”。

8. 边界一旦清楚,“Agent”这个名字可能就会消失

  • 庄明浩的第一条暴论是:“边界不清楚的叫Agent,边界清楚的就不叫了。”按这一说法,AI搜索就是AI搜索,AI Coding就是AI编程;Deep Research明确承担研究任务后,人们似乎也不再强调它是Agent。

  • 群友的吐槽精准概括了概念风险:“上一次遇到包容这么多东西的概念还是Metaverse呢。”Agent越能解释一切,越可能缺乏可检验的业务边界。

  • 对流传的微信Agent路线图,庄明浩认为是假消息:IMA属于CSIG,难成为微信中枢;微信数据高度私人化,权限调用极难;微信连AI搜索都未全量开放,更不可能突然大步放开Agent。

  • 他的判断是,微信未来一定会做Agent,而小程序确实可以成为Agent的“手”。但实现方式与开放节奏会受到隐私、安全及微信一贯谨慎的产品节奏约束。

9. 定价与自动化价值将比概念更早接受检验

  • “黑猫白猫,抓到耗子就是好猫。”统一入口是否会让超级App重新占优,输入是否只能是自然语言,Agent还能否获得浏览器、小程序、虚拟机,垂类场景数据是否仍有价值,都暂时没有答案;项目只能先看ARR与增速。

  • 庄明浩认为Agent未必会永远沿用每月20美元:他列出OpenAI从Free、Plus每月20美元、Pro每月200美元,到设想中的Max每月2,000美元和“博士模型”每月20,000美元,能力差异正在打开定价空间。

  • Manus则把成本落到任务:39美元含3,900积分,199美元含19,900积分,免费用户每月1,000积分。NBA得分效率象限图约15分钟、200积分即2美元;婚礼邀请网页约25分钟、3.6美元;复杂交互应用约80分钟、9美元。

  • Epoch AI的谨慎判断与此呼应:在“可见的未来”,让Agent浏览互联网、操作商业软件、执行标准白领工作,或比培养诺贝尔水平的科研推理模型更有利可图。但推理仍贵、复杂环境仍不可靠、用户仍需盯守和调整——“还有很多事情要做”。