硅谷坐标 x PingCAP联创黄东旭谈Agent 时代基础设施的重构
硅谷坐标 x PingCAP联创黄东旭谈Agent 时代基础设施的重构
摘要
- 黄东旭判断 OpenClaw 标志着 AI-native 应用形态已经出现,但它只是“及格线”——“做得比 OpenClaw 差的属于上一个时代,未来只会比它更好”。 他家里不懂计算机的父母和太太都开始“养龙虾”,自己手握多个 Claude Code + Codex 的 Pro Max 账号,峰值日耗 token 达十亿量级,平日几亿,因而“很兴奋,同时也很焦虑”,有一种“被 agent team 推着往前跑”的感觉。
- Harness engineering 是继 prompt、context 之后的更高维度:多 agent 协同、子 agent 压缩管理、外挂记忆,本质“更像在管一个真正的开发团队”,只是“这帮 agent 不睡觉而已”。 他不认为 harness 有边界——benchmark 只测单 agent、单任务、单环境,“模型本身很聪明了,只是我们的题设计得不好”,未来甚至可能出现“agent 的社会学”。
- 本期最硬的价值判断:LLM 无状态,各家头部模型都聪明,“很多的价值其实会在记忆这一层,而不是大语言模型这一层”。 “它有多了解你呢?还是得靠记忆。”他的 Mem9 插件正解决龙虾“聊着聊着就忘了”的 compaction 失忆和升级丢数据两大痛点,提供开源自部署与云上托管的永久龙虾记忆服务。
- 反直觉的数据量判断:agent 时代不是中心化大数据,而是“海量的小数据”——“你跟小龙虾往死里聊,能聊出一本莎士比亚吗?” 但加总规模可能比淘宝、美团级的中心化数据更大,提供商的策略是全存:“永远不删数据,只要价值能 cover 存储成本”;当下存储短缺在他看来只是“产能临时短缺,会回归”,长期需求持续增加可以预期。
- “一虾一库”是必然趋势,且他认为记忆一定会在云端。 实现是数据库虚拟化:共享对象存储底座上划出虚拟门户,agent“认为自己拥有整个数据库”;因为重度用户可能只有 1%,不必为轻度用户维护专属基础设施。OpenClaw 的 local-first 是极客理念但“牺牲了用户体验”——龙虾养死“跟家里亲人去世的感觉很像”,云端才能“马上再给你启动一只龙虾的身体,接到你的记忆上又复活了”。
- 商业化押注“记忆 marketplace”:黄东旭赌下一代 agent-native application 不会像今天这样由软件工程师编写代码,而有可能由无数领域专家从自己的记忆里提取高价值的东西。 厨师不会写代码,但可把与龙虾聊做饭的记忆抽成外挂记忆接到别人 agent 上收钱,成为“一个新的分发渠道”;基础记忆可能免费,云备份、导入导出可做订阅制增值服务。
- Agent 基础设施会被整体重写——沙箱化的 agent 云、agent 邮箱、支付、权限和 ID 都值得重新设计,现有数据库“给几十亿 agent 提供,成本扛不住”——但 SQL 和文件系统作为模型的心智模型会长期存在。 独立向量数据库“不需要单独出现”:向量检索只是检索手段之一,会收敛为所有数据平台的标准能力。
- 组织形态可能变成部落:他一两人团队“过去三个月干了传统软件公司一百个人年的事”,公司 90% 的代码由 AI agent 编写,他不掌握具体代码细节,“上一个时代软件工程已经终结”,全职 coder 可能会很危险。 但这是软件民主化——这并不是像纺织女工一样让软件变少;正如衣服如今反而穿得更多,软件也可能更多。个人护城河方面,他给出的方向是“保持手感”;年轻人该学 Unix philosophy 这类“永恒不变的东西”。
精读
1. OpenClaw 是“及格线”,从业者被 agent team 推着往前跑
- 黄东旭开场的体感证据:家里父母、太太这些“计算机背景不强的人”都开始“养龙虾”了——这标志 AI-native application 的产品形态已经出现。但 OpenClaw 只是及格线:“做得比它差的属于上一个时代,未来只会比它更好。”
- 他的用量本身是行业信号:多个 Claude Code + Codex 的 Pro Max 账号,峰值日耗 token 十亿量级,平日几亿。反馈闭环极快——“今天我有个想法,马上让 agent 去做,一个小时之后这个东西就上线了。”
- 新的心理状态:agent 会等着你,于是不断 push 自己“下一个想法在哪里”,持续进入想法—反馈—新想法的循环。“很兴奋,同时也很焦虑”——前沿实践 harness engineering 的资深工程师多少都有这种“被 agent team 推着往前跑的感觉”。
2. 从 prompt 到 context 到 harness:层层递进,且看不到边界
- 三代概念的分层:prompt engineering 是 few-shot、无外部工具调用的短程问答(2022 年底、2023 年初直到 2024 年);context engineering 是长程任务、工具调用结果分析、有限上下文空间的高效利用;harness engineering 再升一维——多 agent 协同,要把每个子 agent 的 compaction 考虑进去,并在其上构建信息同步、子任务管理、外挂记忆, “更像在管一个真正的开发团队”。
- 曹卿云问 harness 的边界在哪,答案坦率:“我没有感觉到现在有边界。每一次觉得快到边界了,agent 又能给我惊喜。”更深一层:他们甚至没办法评估当前 SOTA 模型——“模型本身很聪明了,只是我们的题设计得不好”,benchmark 还只测单 agent、单任务、单环境;人类靠组织变成社会,agent 也一样,“也许未来我们会发现一些 agent 的社会学”。
- 终局:harness 本质仍是软件工程,“一个好的 harness 就是一个好的软件工程”,跟管真人团队“没有太大区别,只是这帮 agent 不睡觉而已”。第一阶段用人类几十年的组织架构、工具和方法论做 bootstrap;第二阶段可能出现埃隆所说的递归自进化, “就会超出人类能理解的范围”。他相信各家会有自己的 harness,但“不会脱离传统团队管理和软件开发的 ground truth 太远,还是会收敛的”。
3. 记忆是 harness 最难也最值钱的一层
- Mem9 针对两个痛点:龙虾“聊着聊着就忘了前面的事”——长程任务里上下文一压缩就可能灾难性失忆;以及私密对话可能在一次升级中丢失。方案是开源可自部署+云上托管的永久龙虾记忆服务,安装体验是 agent-native 的:给龙虾复制粘贴一句话,软件就自动安装上去了。
- 概念区分用的比喻值得记:黄东旭把 context window 比作短期记忆,把 memory 比作笔记本——“好记性不如烂笔头”,检索出相关记忆再放回窗口。曹卿云补充认为,只要模型仍基于 Transformer,上下文窗口就是定值;他以开发大型系统软件可能需要几十万个步骤为例,说明外挂记忆的必要性。黄东旭不认可 RAG 作为完整概念:“跟具体的技术绑定得太紧”,因为今天的记忆已经超出原来 RAG 所代表的技术。
- 价值归属的核心命题:ChatGPT 强迫每个任务开新对话,只是用产品形态把记忆问题“掩盖过去了”;大语言模型无状态,“每家可能 top 1 的 model 都很聪明,但它有多了解你呢?”——“很多的价值其实会在记忆这一层,而不是大语言模型这一层。”
4. 设计哲学:把模型本身当评估函数
- 怎么记、怎么提取的答案出人意料地简单:更相信模型自己的能力。团队本想设计精妙的遗忘曲线算法,最终方案是——把相关信息检索出来,每条数据后加一个“这个事实离当前时间有多少天”的标签,全部丢给大模型,再加一句“根据你自己的判断,哪条是最重要的”。“我把模型本身的能力当成一个评估函数。”归纳总结、知识图谱的关联判断,同理全丢给模型。
- 由此推到极端的类比:“也许未来对 agent 最好的安全软件可能就是一句话:‘你要注意安全。’”传统编程逻辑不能直接套用到 agent-native 开发;他甚至认为 coding agent “可能会变成未来的操作系统内核”。
5. 反直觉的数据判断:“海量的小数据”,而且全都要存
- 数据库出身的量级直觉:全世界只有一个淘宝,背后是数百甚至上千 PB 的中心化数据;个人 agent 则相反——“你跟小龙虾往死里聊,能聊出一本莎士比亚这么长的话吗?”只要以文本语言交互,单体数据量就不大,这是他敢于说可以提供“无限记忆”的底气。
- 但对存储供给的含义是看多:海量小数据加总“可能会比中心化淘宝、美团的数据量更大”,只是碎片化到无数龙虾服务商。策略上“无论用户跟他的龙虾聊过什么,我作为提供商一定得存下来,这是对未来最宝贵的资源”——他认同 Google 的 philosophy:“永远不删数据”,只要价值 cover 存储成本;热、温、冷数据,结构化、非结构化数据,以及“人跟机器产生的所有 footprint”,都应该被存储下来。
- 为什么个人数据现在才值钱:过去无法千人千面,只能把所有人的数据汇集起来,给消费者打十个标签(白领、三线城市青年、老人);agent 时代“你的 agent 非常了解你,推荐非常精准,价值就非常高”。至于当下存储产能短缺,他判断“不是什么航天科技,只是产能临时短缺,会回归”,长期需求则会持续增加。
6. 一虾一库,且一定在云端
- “一虾一库”是必然趋势:每个人的记忆结构不同,安全是硬性限制——每个人的数据都应单独加密,个人密钥可能各不相同,“你不会愿意把你的记忆跟陌生人全放一起”。实现是数据库虚拟化:底层用云对象存储做大型共享存储,上面划出一个个虚拟门户,门户里的 agent 会认为自己拥有整个数据库。经济账是,重度用户可能只有 1%,不能为一天聊两三句的用户维护专属基础设施;对 agent 的正确抽象是“与其教它在存储服务上注册账号,不如直接告诉它:你现在看到的就是一个完整的数据库,随便用”。
- 云端 vs 本地,他给的是产品结论而非安全结论:OpenClaw 是 geek 设计的,Peter 是“一个特别极客的人”,理念是 local first——安全、没有云端“邪恶公司”控制数据,但“牺牲掉用户体验”,用户可能经常把龙虾养死,“跟家里亲人去世的感觉很像,很吓人”。如果要成为 C 端产品,他认为“一定是云端”:“龙虾养死了,但我的数据还备份着,马上再给你启动一只龙虾的身体,接到你的记忆上又复活了。”
7. 商业化:从备份订阅到“记忆 marketplace”
- 他首先提到的付费场景是记忆的备份恢复:基础记忆可能免费,导入导出、云备份可以做订阅制增值服务——“但它肯定不是企业级产品的定价模式”。
- 更大的赌注是记忆成为通用基础设施:他在赌下一代 agent-native application 的形态——不会像今天这样由软件工程师编写代码,而有可能由无数领域专家从记忆里提取高价值的东西,甚至可能只是“一堆 Markdown 文档”。厨师完全不会写代码、只会做饭,天天跟龙虾聊做饭,把这份记忆抽取成外挂记忆接到别人的 agent 上,通过 marketplace 收钱——“你就变成了一个新的分发渠道”。
8. 基础设施整体重写,但 SQL 与文件系统的心智模型长存
- 面向 agent 的基础设施一定会出现:今天的云、数据库、网络本质上面向开发者;agent 的云不会是 AWS、GCP、阿里云的现有形态,而可能是一个个沙箱——Manus 的形态相当于给 agent 一台小电脑,里面什么都有,agent 可以在里面工作。数据库的账算不过来:现在最便宜的库一个月也要几美元, “给几十亿 agent 提供,成本扛不住”,必须重写底层实现。同样逻辑套到通信(“谁在给 agent 提供邮箱服务?没有”)、支付、权限和 ID——都是值得重新设计、 “非常朝阳、同时又非常重要的事情”。
- 接口层却要保守:模型从人类数据训练而来,SQL 和 file system 是它最熟悉的操作计算机的心智模型——所以 Mem9 的记忆通过数据库接口提供,OpenClaw 原生记忆本身就是一堆 Markdown 文件。 “在 agent 自我进化出更符合自身使用方式的接口和形式之前,这些经典心智模型会长期存在,只是下面的实现不一样。”
- 对向量数据库的判断,他自称“有点极端”:向量检索只是若干检索手段之一(还有全文匹配、原始信息过滤),单独拆出来对 agent 不友好——“不需要单独出现一个向量数据库”,它会成为所有数据平台的标准能力,接口收敛;而在个人数据语境下,“多高的性能、多大的数据量其实没有什么意义”。
9. 好体验的判据是 Unix 哲学;多 agent 里可能藏着新 scaling law
- 给 agent 做软件怎么算好用?他的猜想是:“对开发者友好的体验,一样也会对 agent 友好。”GUI 不可组合——“两个图形界面的东西不能融合出第三个图形界面”,命令行可以;Unix 哲学最近又火,核心正是“方法论原则就那么几个,但通过组合能变出一个更大、更复杂的世界”,用一套简洁、自洽的心智模型囊括尽可能多的灵活任务。
- 下一个突破边界的猜想,明确标注为 open question:“我隐约觉得组织多个 agent 干复杂任务的过程中,会 somehow 存在一种 scaling law——放一百个、一千个、一万个进去,能产生什么效果?”
- 人与 agent 的协同只发生在最上层:提需求、验证交付结果、通过 skill 或 spec 传递经验;agent 怎么开会、怎么管理,“你可以给它一些点拨,但不要参与进去——你一旦参与进去,就变成整个系统的瓶颈了”。
10. 组织可能变成部落,护城河在于手感
- 他的实证:Mem9、DB9 都是一两人团队、他一人主力,“过去三个月干了传统软件公司一百个人年的事”。软件生产在黑盒化:公司 90% 的代码由 AI agent 编写,他每天数万行代码 check in,却“完全不知道 AI 写了什么”,不看具体代码细节,只管架构、软件工程和“代码不要快速腐化”等更上层的事——编程语言“既重要又不重要”。
- 对码农的判断直白但带有个人判断:“上一个时代的软件工程已经终结了,确实不需要这么多软件工程师了”;如果是全职 coder,“可能会挺危险”。未来组织可能是“一个个小型的部落”:强 harness engineer 带 agent team,配一个了解现实问题但不会编程、也不会做软件的领域专家。但这被他视为软件民主化的好现象,并不是像纺织女工一样让软件变少——正如衣服如今反而穿得更多,软件也可能更多。
- 他自己那句“细思恐极”的话——所有认知一个月后可能严重过时——的自答:“一定要身处这个浪潮之中,保持手感”;看科技文章或听类似今天这样的对话都不是最高效的学法,“最高效就是亲自去用”。给焦虑的计算机专业学生:学“永恒不变的东西”——Unix philosophy、经典软件工程、思维模型;“如果学计算机只是为了找一份码农的工作,你就得想一想你真正喜欢什么”。彩蛋由黄东旭推荐《禅与摩托车维修艺术》;曹卿云说自己看过无数遍。黄东旭认为这是一本让人认真思考“造物这件事情的本质是什么”、为什么享受把东西做好、什么是好东西的书。