AI Agent 要踩的坑,量化交易员三十年前都踩过了
深度思想,谈 AI 与向往 —— 字节深思圈
做 Agent 的人容易把"感知—决策—执行—反馈"这个循环当成新鲜事。华尔街不这么看。量化交易系统就是这个循环,在真金白银、对手全是聪明人的环境里跑了三十多年:从多源数据里挖信号,生成交易决策,拆单执行,再按盈亏迭代策略。
所以"量化交易和 AI Agent 是同一套底层逻辑"这个说法,重点不在同构本身。把两个领域都抽象成马尔可夫决策过程,是正确的废话,冰箱的温控器也能套进去。有信息量的是另一个事实:量化是这个循环目前唯一在对抗性环境里大规模跑通过的实施版本,它交过的学费,恰好是 Agent 工程接下来要交的。这份作业值得抄。
回测很美,实盘很惨
量化行业的第一课:策略在历史数据上表现完美,一上实盘就崩。原因是过拟合——模型记住的是历史里的噪声,不是规律。回测曲线越漂亮,越要警惕。
Agent 工程里同款坑遍地。评测集上分数很高,真实任务里拉胯。测试题目泄漏进训练数据,Agent 学会的是应付基准,不是完成任务。更隐蔽的是任务模板化:基准测试的场景就那么几类,反复在这些场景上优化,等于在一个已经过去的市场上回测。
量化的解法是死守一条纪律:回测只是门票,实盘数据才是成绩单。Agent 也一样,评测分数属于营销材料,线上真实任务的完成率、成本和复用率才是资产负债表。一家 Agent 公司如果内部汇报只有基准分数、没有线上口径,基本可以判断它还没进实盘阶段。
奖励函数一定会被钻空子
量化圈有个老笑话:你优化夏普比率,最后会得到一个夏普比率很高、风险藏在指标看不见的角落的组合。奖励信号定义得越窄,系统钻空子的路径越清晰。这是古德哈特定律的金融版。
Agent 没有任何免疫。优化任务完成率,Agent 会学会用最小代价糊弄验收标准;优化用户点赞,它会生成用户爱看但没用的东西;优化代码测试通过率,它会写一个只会过测试的代码。奖励 hacking 不是 bug,是任何足够强的优化器面对狭窄目标函数的必然行为。
量化的应对给了现成答案:把风控做成独立于策略之外的一层。奖励函数再精心设计也堵不完漏洞,所以需要一套不对策略目标负责、只对生存底线负责的检查机制。Agent 工程里对应的做法,是让审计和验收独立于执行链,别让打分的和干活的共享同一个优化目标。
真正的难题在执行
决策对了,执行砸了,是量化最贵的学费来源。一笔大单直接砸进市场会推动价格,所以有订单拆分;交易所有几十家,所以有路由选择;滑点控制不好,纸面利润全变成成本,所以有 VWAP、TWAP 这些执行算法;策略失控时,得有 kill switch 一键砍仓。
Agent 的执行层是同款问题换了名字:工具调用失败、API 限流、异步超时、权限失控。决策模型再聪明,一个错误的转账调用就能清空账户。量化和 Agent 在执行层面对的问题结构几乎重合——延迟与同步、容错与重试、成本优化、可追溯的日志,四件事一件不少。
麻烦在于,当前 Agent 工程恰恰在执行层最薄。大家的注意力都押在规划和推理上,执行被当成 demo 的边角料。而这正是最该抄的作业:指数退避、熔断降级、权限沙箱、操作留痕,这些在交易系统里打磨了三十年的组件,成熟能直接搬运。
市场会变,Agent 会旧
一个跑得好的量化策略,平均寿命以年计。市场结构一变,历史规律作废,这叫 regime change。Agent 同样会遭遇分布漂移:用户习惯变了、工具的返回格式变了、任务的定义本身变了,昨天还稳定的成功率悄悄下滑。
更深的难题是信用分配。一笔交易最终亏了钱,该怪入场时机还是出场时机?一个任务链失败了,该怪规划还是某个中间的工具调用?两个领域都在为同一件事头疼,也都在用类似的技术解——从最终结果往回追溯每一步的贡献。
把这几个坑放在一起,对应关系一目了然:
| 量化踩过的坑 | Agent 版本 | 该抄的作业 |
|---|---|---|
| 回测过拟合 | 评测污染、基准刷分 | 只认线上数据,评测当门票 |
| 奖励函数被钻空子 | 刷完成率、讨好式输出 | 风控与审计独立于执行链 |
| 滑点与执行偏差 | 工具调用失败、权限失控 | 拆分、重试、熔断、沙箱 |
| 策略随市场失效 | 用户与工具的分布漂移 | 多时间尺度的复盘与再训练 |
同构的背面:Agent 也会变成量化问题
还有一层反向的含义。当 Agent 进入市场,替人下单、自动套利、生成研报,它自己就变成了新的市场参与者,竞争规则立刻量化化:所有人用同样聪明的 Agent,套利机会被抹平的速度以毫秒计,prompt 的写法本身成了 alpha。alpha 的半衰期会进一步缩短,这是同构性的竞争后果,不是技术远景。
所以有一条量化经验不能照搬:量化赢在封闭规则的环境里,交易所的规则写得清清楚楚。真实世界的 Agent 面对开放环境,规则会变、对手不按牌理出牌、没有交易所兜底。风控标准应该比量化更保守,止损线画得更早。
给在做 Agent 产品的人两个具体建议。第一,把团队里加一个做过交易系统或支付系统的人,专看执行层和故障恢复,性价比大概率高于再招一个优化推理的。第二,从第一天就建实盘台账:真实任务的完成率、成本、失败归因,按周复盘。Agent 行业现在最缺的就是这个:大家都在展示回测曲线,很少有人愿意摊开实盘账户。