杀死一个Agent项目的,往往不是不够聪明
深度思想,谈 AI 与向往 —— 字节深思圈
2025 年的 YC 春季批次里,144 个项目中有将近一半声称自己在做 Agent。同年 6 月的 YC AI Startup School 上,马斯克来预言数字超级智能,Altman 谈工作流,Karpathy 谈评测。表面上,这是一场给 Agent 创业加油的大会,但真正在会场里流动的是一个更冷的问题:为什么那么多 Agent 项目,demo 漂亮,就是上不了线?
我的判断很直接:把概率系统当成确定性函数来造,才是大多数 Agent 项目的死因。
多数团队在用一个错误的假设造 Agent
造 Agent 的常见姿势是:调一个大模型,加几个条件判断,把几步操作串成一个工作流。这里藏着一个隐含假设——模型的输出是稳定的,像调用一个函数,同样的输入给同样的输出。
但 LLM 的输出是概率建模,不是确定性计算。同一个任务,今天跑得通,明天可能跑偏;在这个上下文里一致,换个上下文就不一致。建在这样的假设上,Agent 的每一次运行都是一次赌局。除非每一步都配了自动化评估,否则这套系统既不能被测试,也不能被复现。
Karpathy 在那场会上有个很贴切的比喻:LLM 像住在云端里的怪才,能写出超越人类的代码,但偶尔也会拼错你的名字。他的提醒很直白——没有严格评测、持续集成和异常处理,就拿它做生产系统,做的不是工程,是信仰。
很多项目展示的恰恰是这种信仰。demo 跑通,不等于产品能跑。demo 是最好情况下的一次抽样,生产是最坏情况下的长期拉练。
调用顺序不是流程,流程是责任结构
Altman 在会上反复强调,Agent 的未来在于跑完整的工作流。很多团队把这句话听成了"把调用排好顺序"。这是最容易犯的误解。
调用顺序解决的是"先做什么后做什么",流程解决的是"出错了谁负责"。真正能上线的流程,是一套对时间、因果、权责有强约束的行为链:某一步出错,谁负责?怎么回滚?用户是否被通知?结果能不能解释?
拿一个处理客户投诉的 Agent 来说。提示词接龙的写法,是把接待、安抚、补偿三步依次串起来。责任链的写法,是回答这样一串问题:哪些关键词触发升级给人?误判了怎么纠正?情绪识别失败时默认什么动作?安抚失败后是沉默还是转人工?有没有二次核查?这些判断点决定了 Agent 是"跑得通"还是"炸得快",而它们依赖的不是模型参数量,是对业务的抽象和对容错的设计。
市面上大量所谓"流程型 Agent",本质是提示词接龙——逻辑连贯,但结构不存在。这样的系统一遇到边界场景、业务变更、监管介入,就会瞬间失效。
反过来看那些能上线的项目,差别往往就在这套结构上。它们会在高风险动作前设一道人工闸门,把每一步的输入输出存档,出错时能精确回到上一个检查点,并且给每个 Agent 划好权限边界——它能碰什么数据、能动多少钱、能不能对外发消息,全都写死。这些东西在 demo 里看不见,但它们决定了 Agent 能不能进真实业务。
客户不为聪明付钱,为放心付钱
还有更现实的一层:真到了卖 Agent 的时候,客户并不关心它有多聪明。他关心的是:这东西能不能接入我现有的系统?有没有安全审计接口?出了错能不能追溯决策路径?能不能跟人协同担责?
换句话说,企业采购买的不是智能,是放心。智能可以从模型 API 那里买,放心只能从你自己的流程设计里长出来。
这也是监管为什么会变成入场门槛。多数团队把合规当被动应对——先上线,出了问题再说。但审计机制、责任回溯、行为日志这些东西,一旦内嵌进产品架构,就会在政策收紧时变成对手跨不过去的坎。Nadella 在那场会上反复提 GDP,背后的逻辑也是这个:AI 要证明自己创造的是新价值,并且可解释、可追责,才能持续拿到社会许可。
行业理解的价值同样落在这里。一个 Agent 能不能落地,常常不取决于 AI 最擅长的部分,而取决于那些必须有人插手的部分:什么时候该回答,什么时候该转交,什么时候该沉默。这些判断没法从论文里学,只能在行业里泡出来。YC 投 Agent 项目时越来越看重创始人是否来自那个垂直领域,而不是是否懂 LLM,原因就在这。
反方观点:这不就是老一套软件工程吗
最强的一条反方意见是:测试、灰度发布、回滚、CI/CD,都是过去几十年软件工程的标准配置,有什么新鲜的?
新鲜在于难度的量级。传统软件嵌入的是确定性逻辑,测试用例基本可以穷尽;一旦嵌入非确定性模型,你没法枚举所有输出,只能设计评测的分布、失败的容忍度和回滚的机制。同一套工程纪律,搬到概率系统上,难度翻倍。
另外,demo 的廉价化改变了供需结构。过去做一个像样的 demo 要花功夫,所以 demo 本身就算实力的证明。现在任何人很快就能搭出一个 90 分的 demo,90 分的 demo 就什么都证明不了了。当聪明变得人人可展示,能被付钱的就只剩下可靠。
还有人会问:模型能力还在涨,等模型更强了,这些问题会不会自动消失?我的判断是否定的。模型越强,它能造成的破坏半径越大,对验证和兜底的要求只会更高,不会更低。可靠性从来不是模型免费赠送的附件,它是产品自己要建的工程。
所以我把它归纳成一句话:Agent 创业里,可验证性就是护城河。谁能证明自己的系统是可靠的、且在持续变好,谁才有产品;其他人手里只有实验。
对做 Agent 的人意味着什么
Agent 创业看起来做的是 AI 技术,真正拼的是"行业流程 + 不确定性工程"。模型能力在趋同,API 是商品,真正能沉淀下来的只有两样:你对某个行业流程的理解,以及你把不确定性管成工程的能力。
上线之前,可以先用三个问题自查一遍。
第一,系统有没有自动化的评估机制?你能不能用数据证明这一版比上一版更好,而不是靠人肉看几条输出?
第二,每一步出错时,谁负责、怎么回滚、用户知不知道?把答案写下来,写不出来的地方,就是将来会炸的地方。
第三,除了 demo,有没有一个付费客户在真实业务里天天跑它?客户的续费和投诉,才是唯一诚实的评测集。
这三个问题答得出来,做的才是系统;答不出来,demo 再漂亮,也只是烟花。