⚡ 深入 GitHub 的 AI 革命:Jared Palmer 揭示 Agent HQ 与编程 Agent 的未来
摘要
- GitHub 正将 Agent HQ 定位为编程 Agent 与开发者期待中的归宿,而不只是又一个自研助手。 主持人提到 GitHub 拥有1.83亿开发者,Jared Palmer 则称 GitHub 的开发者数量已超过1.8亿。Jared 表示,GitHub 可以将 Copilot、Copilot CLI 与 Claude Code、Codex、Devin 等第三方 harness 组合起来,形成吸引 Agent 和开发者的“引力井”。其战略资产在于掌握工作流并提供 Agent 选择,而不是依赖单一模型。
- V0 的历史表明,只有当产品形态与边界跟上之后,模型进步才会被爆发式地货币化。 Jared 称,初代产品用了约9个月达到100万美元 ARR;主持人表示,模型能够支持聊天后,一次重写让收入大约每14天增加“另一个100万美元”,产品由此变成“一艘火箭”。Jared 将其归因于对 Next.js、前端和 shadcn 的刻意聚焦:“这种约束反而让人如释重负。”
- 真正相关的抽象,正在从模型切换器转向与算力、文件、工具和运行时紧密耦合的 Agent。 讨论认为,松散的模型接口最终会向最低公分母收敛。Jared 将编程 Agent 的配置称为一个独立的“Agent 世界”,其中包括沙箱、文件系统和工具调用。因此,价值正转向 harness、专业子系统、评测,以及围绕模型构建的基础设施。
- GitHub 短期的切入口,是覆盖软件生命周期的环境式 AI,而 VS Code 集成则提供了杠杆。 演示中,一个从 Agent HQ 发出的任务会进入 pull request,并可一键在 VS Code 中打开;Jared 还将 issue 分配、合并冲突和损坏的 Actions 视为介入点。未来大约6个月,他的重点是在移动端、Web、GitHub.com 和编辑器中,以“撒盐哥式”的方式铺开 AI。
- 从90%的成功率走向“多个9的成功率”,剩下的斜坡靠的是可靠性,而不是又一种炫目的模态。 对于编程 Agent 之后是什么,Jared 的答案很简单:“把它们做好”;98%与99%正确率之间的差异非常明显,而多轮会话会放大供应商故障。在 Vercel,关键指标大约每3小时汇总一次,包括无错误会话、延迟、请求丢失和基础设施错误。
- 可复现的仓库配置仍是尚未解决的基础设施瓶颈,dev containers 虽有前景,但还没有成为标准。 一个专注于 Next.js 的系统可以假设存在安装 package 的路径;通用 Agent 却无法预测某个仓库是否暗中依赖 ffmpeg 之类的组件。讨论提到 Microsoft 内部存在相互竞争的运行时方案,并将共享默认值、自动检测和抢占式处理视为尚待开发的机会。
- GitHub 正在将 Agent HQ 与迟来的核心产品修复结合起来,但它的规模意味着,即便是热门需求,也需要付出高昂的落地成本。 重新设计后的首页如今突出任务和最近的 pull request,而社区呼声最高的 stacked diffs 也重新进入积极探索阶段。内部尝试最早可追溯到2020年,包括一个完成度很高的2022年实现,但由于它把 pull request 之外的 stack 引入系统,被认为风险过高。
精读
1. V0 如何将狭窄约束转化为模型进步与产品增长
Jared 的起点早于任何 Vercel AI 团队:当时他负责 Next.js、Turborepo、Turbopack、webpack 和内部工具的工程管理,将一次 Server Actions 的内部试用变成了 AI 试验场。Guillermo 告知 nat.dev 将于周一上线,迫使他立即交付;这次试验也让他逐一处理了各家供应商的 API 和流式传输问题。
这个试验场后来变成 AI SDK,因为 Jared 已经将可复用的流式传输层抽离出来,同时没有把开发者锁定在某一家供应商上。它切入的是 UI 层:提供有用的抽象,但不妨碍开发者。随后,一个用 shadcn 构建的开源 ChatGPT 模板为小团队提供了功能完整的基础,支持快速试验:“这让人如释重负。”
Code Interpreter 催生了最初的生成式 UI 构想:代码执行可以输出表格数据,另一个 prompt 可以将其渲染出来,输出还可能彼此串联。但当时还没有工具调用,上下文窗口只有4,000 tokens,后来扩大到约16,000 tokens;而允许联网执行又引发了安全争论。代码执行的方向被搁置,prompt-to-UI 成为了 v0 的“顿悟时刻”。
2023年9月前后,v0 以“React 版 Midjourney”的形态上线,通过可选的视觉变体来工作,因为当时可靠的聊天能力还不存在。GPT-4 和 GPT-4 32K 的进步抬高了上限,但 Jared 承认:“我们始终没真正让 GPT-4 Turbo 跑起来——我也不知道为什么。”
在商业化方面,Jared 称,第一版产品用了约9个月达到100万美元 ARR。主持人随后表示,模型能够维持聊天、artifact 模式成熟之后,团队重写了产品;重新上线后,收入大约每14天增加“另一个100万美元”,产品由此变成“一艘火箭”。真正持久的优势,是专注于 Next.js、前端和 shadcn。主持人还提到,Vercel 曾向前沿实验室共享其 post-training harness 和经过清洗的数据。
2. Agent 正在取代独立模型,成为产品单元
讨论围绕两种路径展开:整合不同模型的最佳能力,或直接向用户开放模型选择器。复合式方案可以引入专业子系统——搜索不必使用生成模型——也能通过拼接不同组件提升性能,并让产品掌握自己的品牌。
经济账有利有弊。品牌化的供应商模型可以获得联合发布带来的推广,但计费实际上会锚定在该供应商的零售价附近,从而限制溢价空间。Jared 补充称,复合式方案可以在独立于模型实验室的情况下支撑可持续业务,同时真正改善性能。
主持人认为,模型层已经不再是正确的切换抽象:模型与 Agent harness 必须“高度、高度耦合”,否则通用接口就会继承最低公分母。Jared 将编程 Agent 的配置描述为一个独立的“Agent 世界”,涉及循环、算力运行时、文件、沙箱和工具调用。
Agent HQ 正体现这一转变。GitHub 提供 Copilot 和 Copilot CLI,同时容纳 Claude Code、Codex 和 Devin 等第三方 harness。Jared 希望它成为 Agent 和开发者的“归宿”,提供选择,而不是强迫用户采用单一的第一方技术栈。
Skills 又把接口向下推进了一层:主持人将其描述为一个 LLM 原生的软件包,Agent 读取 Markdown 和一个文件目录,使文件系统成为通用接口。讨论强调 MCP 是连接企业上下文的重要机制,而 GitHub 已宣布的 custom agents 则可以将特定任务的 prompt 与 MCP 能力结合起来。
3. GitHub 的优势,在于掌握开发工具之间的接缝
V0 优化的是一个框架和一个问题;GitHub 覆盖所有语言、框架,以及主持人提到的1.83亿开发者。Jared 上任才第13天,称这一规模“非常庞大”,并将 Agent HQ 放入更广泛的 Microsoft CoreAI 组织,该组织包含 GitHub、Visual Studio、VS Code 以及 Azure 的部分业务。
目标体验是连续的,而不是围绕某个目的地展开:发起任务,收到 pull request,然后一键在 VS Code 中打开。Jared 希望 AI 被嵌入现有的摩擦点——分配 issue、解决合并冲突,或修复一个远程失败但本地正常的 Action——让开发者无需脱离工作流。
未来大约6个月,他的重点是让移动端、GitHub.com、Web 和本地编辑器之间的切换无缝衔接。最有记忆点的说法,是以“撒盐哥式”的方式把 AI 撒进原生工作流;Agent HQ 与 GitHub 将共同演进,而不是变成一个孤立的 Agent 控制台。
Jared 认为 dev containers 是一种重要的轻量级沙箱概念,并提出它是否应该成为标准。主持人指出,它们可以打包 VS Code、文件系统、沙箱、安全控制和 GitHub Enterprise 连接能力,同时也提到 Microsoft 内部存在相互竞争的运行时方案。
Jared 认为,仓库配置是 Cognition 面临的头号痛点,Codex 以及其他 Agent 想必也有同样的问题。他指出,Next.js 专业 Agent 往往可以假设执行
npm install;主持人则解释,通用系统无法预判 ffmpeg 之类的隐藏依赖。讨论指向自动检测、抢占式处理和共享默认值;主持人还回忆了一个未能实现的开源框架检测器构想,希望推动生态从 npm 一起迁移到 Bun。
4. 更好的 Agent 需要可靠性工程,而不只是更聪明的模型
当被问及 Copilot 之后、更加自主的编程 Agent 之后会是什么时,Jared 拒绝追逐某个戏剧性的新类别:“把它们做好。” 从90%提升到95%、98%、99%,最终达到“多个9的成功率”,难度会不断加大,而“98%正确和99%正确之间存在巨大差异”。
他警告称,许多 AI 团队对质量的判断都“活在 La La Land”,因为它们没有衡量无错误会话、供应商故障、请求丢失或延迟。在 Vercel,关键指标大约每3小时汇总一次,形成一种近似“电子游戏式”的运营循环,让好日子还是坏日子都能立即显现。
基础设施可靠性本身就是模型质量的一部分,因为推理服务还没有像数据库那样具备可靠的正常运行时间。不同供应商在性能和可用性上各不相同,而且“总是在宕机”;Jared 将 OpenRouter 和网关产品的成功,与多轮 Agent 会话期间切换供应商和故障转移的需求联系起来。
Computer use 仍是讨论中的一种模态:Jared 称,它过去以慢、差、不准确而闻名,但正在改善,尤其是在 DeepSeek-OCR 和 olmOCR 等开放视觉模型的推动下。主持人认为其计算成本很高。Jared 仍强调最后的困难阶段:“细节决定成败。”
Jared 也将 Agent 用于个人工作流。他让 Claude Code 处理父亲的会计表格,后者生成了 Python 脚本,看起来比 ChatGPT 更好,但后来“跑偏了”。他使用 Agent 浏览器,目前主要用 Atlas,同时保留带有垂直标签页的 Arc;他还构建了 Chrome Dump,通过 Markdown 汇总并关闭数百个标签页。主持人惊讶于数据分析 Agent 仍相对欠发达,许多组织仍处于 BI 时代,而不是通过 Slack bot 查询精准分析结果。
5. GitHub 正重新打开核心工作流,进行修复
Jared 引用了 RZ 在2025年5月22日发布的一条推文,称“GitHub 首页基本上完全没用”;该推文获得130万次浏览和19,000个点赞。新版首页以任务、最近的 pull request 为核心,同时保留最近仓库等元素。Jared 认可这次重做,但强调:“还有更多工作要做。”
Stacked diffs 是更大的工作流之争。Jared 的比喻是,一连串 pull request 每个只包含一个 commit:开发者可以修改更早的 diff,再将依赖其上的工作重新堆叠;如果系统支持,也可以自动 restack。之后整个 stack 可以被压缩并合并,更复杂的配置还可以选择哪些层需要 CI。对于 monorepo 和超大型代码库,这种方式让审查和更新比传统 pull request 更顺畅。
多年来,这一需求一直位居 GitHub 社区需求榜首。Jared 发现,相关尝试最早可追溯到2020年;2022年还有一个完成度很高的客户端实现,但它把 stack 引入了 pull request 之外的模型,因此被认为规模过大、风险过高。该功能如今重新进入规划,但 GitHub 的规模和 Git 实现意味着,这“绝不是在公园里散步”。
这种张力体现了 Jared 的工作姿态:对外展现响应速度,但不承诺轻松交付。他的私信仍然开放,因为“所有反馈都是礼物”,而且“所有反馈都是信号”;收集更多反馈,应当有助于改进 Agent HQ 以及底层那些不那么光鲜的 GitHub 基础组件的决策。