Cursor 的第三时代:云端 Agent——Sam Whitmore、Jonas Nelle、Cursor
摘要
Cursor 押注的是能够运行一套完整配置“盒中大脑”的云端 Agent,而不只是编辑器里的代码生成器。 演进路径是 Tab 自动补全→本地 Agent→Agent 在自己的电脑上独立处理3分钟、30分钟、3小时,甚至3天的任务。让模型获得像素、终端、浏览器、文件和开发服务器后,它们便从“视读代码”走向产出经过测试的软件。
闭环验证是此次发布最重要的产品变化:Agent 默认执行测试、展示结果,并保留机器供人检查。 云端 Agent 可以复现 Bug、记录失败、实施修复,再记录通过后的流程。Alessio Fanelli 表示,这能把难以复现的 Bug 变成大约90秒即可合并的改动;swyx 认为,有演示支撑的修复很容易合并。产出不再是“我试了几个办法 PR”,而是“我测试过了 PR”。
代码生成已经便宜到足以让审查、CI/CD 和生产环境信心成为稀缺资产。 视频可以解决“toggle”和“checkbox”这类意图层面的错位,Bugbot 则审查代码本身;Cursor 员工表示,他们在多次发现被忽略的 Bugbot 评论确实指出了真实 Bug 后,学会了等待。更广泛的判断是,10人初创公司很快也会需要过去只有1万人组织才会配备的分阶段发布、合并队列、堆叠式 diff 和回归检测。
乐观情景的驱动力是吞吐量,而不是让单个 Agent 再快一点。 讨论提到,系统可以同时运行约100个 Agent,每秒生成数千个 token;当 Agent 推送代码的规模相当于将人手扩大10倍时,GitHub Actions 已经被压垮。这个框架很有记忆点:别再优化“让水流得更快”,而是把“管道做得更宽”。
即使模型实验室之间的领先者持续变化,模型路由也可能成为 Agent 层的长期优势。 Alessio Fanelli 从“Opus 4.5 maximalist”转向使用 Codex 5.3,而 Cursor 希望同时提供明确选型和类似 Auto 的默认模式。更有意思的是,一项尚未发布的实验发现,Agent 式合成器可以把不同供应商的输出组合成新的 diff,并获得“协同式”的质量——这是一种跨模型的“委员会”,而不只是从多个结果中挑最好的一个。
云端 Agent 正把开发从个人 IDE 拉向 Slack 这类协作协调界面。 同事可以在产品讨论串里召唤 Agent,补充上下文、@相关人员、检查产物,再决定是否合并;swyx 表示,同样的模式也会覆盖市场、设计、销售和法务。人的对话越来越集中在“我们要不要发布?”和“这是不是正确的 UX?”上,具体实现则逐渐退到后台。
Cursor 预计,Agent 经济将从每月20美元的自动补全,经本地 Agent 的数百美元,升至每个人数千美元,甚至可能数万美元,用于并行运行云端 Worker。 其解释是杰文斯悖论:软件生产成本下降会扩大目标和消费,而一个人具备完成10个人工作的能力后,理性上也会购买更多推理量。由此隐含的需求包括模型、持久化 VM、CI 容量、审查系统以及周边的生产流水线。
云端迁移尚未完成,因为环境配置、持久记忆和 Harness 自我认知仍然很难。 Alessio Fanelli 预计,云端 Agent 的使用量将在年底前超过本地 Agent,并在年底前达到本地 Agent 的2倍以上,但也明确表示,这可能比人们预期的更久。Cursor 认为,真正的解锁点在于:Agent 能记住仓库特有的细节,审计自身指令中的缺口,并理解环境允许它做什么,以及如何安全地改进自己的上下文。
精读
1. 云端 Agent 用更长的委托闭环取代“手写代码”
Cursor 的演进路径从 Tab 和自动补全,到本地 Agent,再到在自己电脑上工作的云端 Agent。逐字符敲代码已经开始变成团队戏称的“手写代码”(hand coding)——“哦,这很可爱。你真是个老古董。”
早期云端 Agent 运行在空白 VM 里,基本是在“视读代码、吐出 token,然后希望你做对了”。此次发布会像搭建开发者环境一样为每台机器完成初始化,再给模型终端、应用、像素、坐标,以及运行自己写出的内容的能力。
交互单元正从一次 Tab 补全,扩展到30秒至3分钟的任务,再到3分钟、30分钟和3小时的工作。Cursor 不希望 Agent 交回一份立即需要人工检查的 diff,而是希望用户收到经过测试的预览,在更高抽象层上工作。
2. 经过测试的 PR、演示视频和在线 VM 构成一套审查包
演示中,Agent 工作了半小时,因为它启动了开发服务器、端到端测试功能,并在必要时反复迭代。理想的交付物是一个“我测试过了 PR”(I tested it PR),就像人类会等工作真正准备好后再请求审查。
测试是默认动作,但会根据任务校准:简单的文案修改可以跳过,复杂工作则不应跳过;用户也可以调用
/no-test,或在AGENTS.md中写入仓库特定的例外规则。目前由模型判断默认指引是否适用。视频是第二根支柱,因为审查生成代码正变成瓶颈。最典型的规格不充分,是需求写着“toggle”,实现却返回了一个 checkbox;视频能立即让共享产物和意图错位变得一目了然。
第三根支柱是完整的远程桌面和终端控制。视频可能足以支持合并,但更多时候,它只是证明方向正确;用户随后可以检查在线预览,再发出两三个后续指令,直到功能真正准备好。
3. 完整电脑访问让 Bug 复现成为产品原语
为测试超大密钥错误,Agent 自行打开 DevTools,用 JavaScript 生成5,000个“A”字符,将其粘贴进输入框并触发新的错误。这个例子把后端错误处理和前端验证连在了一起,而 Agent 事先并不知道该如何触发这个限制。
Cursor 把“复现—修复—验证”变成了
/repro。针对一个附件 Bug,Agent 使用原生文件选择器,证明5张本应被移除的图片仍然传给了另一个 Cursor Agent,修复代码后又重放了完全相同的流程,显示最终只剩1个附件。swyx 将这个流程与奖励投机和红绿 TDD 联系起来:先证明测试失败,再让它通过。Cursor 对自动复现仍然较为保守,因为这会增加运行时间;但明确提出“修复这个 Bug
/repro”,就会同时要求两段证据视频。
4. Slash command 将内部操作变成可复用的 Agent 工作流
Alessio Fanelli 的内部
/fix-bb命令会把 Bugbot 的发现回传给原始 Agent,保留通用自动修复可能缺失的提示词和实现上下文。对于不需要额外历史信息的场景,Cursor 也已经推出 Bugbot Autofix。swyx 提到一个云端 Agent 诊断命令:它通过 Datadog MCP 扇出多个子 Agent,搜索日志,并返回某个问题 Agent 实例的候选原因。原本需要手工翻查日志的工作,现在变成一次 Agent 调用。
Cursor 还曾把一个 Agent 的 transcript 传给另一个 Agent,让后者充当外部调试器,或直接 fork 这段对话。Transcript 包含完整的执行历史,额外的基础设施则把这段历史挂载到其他情况下共享的云端 Agent Harness 上。
swyx 对 Datadog 的战略追问是:作为事实记录系统的供应商,是通过 MCP 暴露日志,让编码 Agent 捕获自愈流程,还是试图用自己的 Agent 产品来掌控这件事?Alessio Fanelli 的回答更窄也更直接:“我只知道,我喜欢 Datadog MCP。”
5. Slack 正在成为 Cursor 的协作式 IDE
Alessio Fanelli 形容 Slack“基本就是一个 IDE”。在 issue 或产品讨论串里发起 Cursor 任务后,云端 Agent 会启动;团队成员可以继续补充上下文、检查产物,协作推动工作走向 PR。
Agent 可以查看 blame,并@应该加入讨论的人。swyx 把例子扩展到开发者之外:技术市场、设计、销售和法务都可以从各自领域纠正同一个 Agent,同时共享一个可见的讨论串。
Alessio Fanelli 的主线判断是:人类剩下的工作,是“真正有趣的东西的那一点内核”——要不要发布、哪种 UX 或形态更合适,以及如何让意图变得明确。只有在被明确提及时,Cursor 才会响应,因此人类仍然可以先彼此讨论,不会被 Agent 打断。
6. 代码生成已经跑在了从 PR 到生产的路径前面
Cursor 内部的玩笑是,任何产品讨论很快都会变成“我已经有一个 PR 了”。更难的跃迁,是从拥有第一版草稿到有足够信心合并,因此相较于原始 token 生成,审查已经上升为下一个瓶颈。
swyx 清楚地提出了分歧:一派认为 AI 生成的代码需要 AI 审查;另一派认为审查已经死亡,有视频就够了。Alessio Fanelli 保留了两者的区别——视频检查功能层面的对齐,工程师仍然要检查文件,而 Bugbot 执行代码层面的审查。
Bugbot 在内部建立的可信度来自行为,而不是理论。Cursor 要求员工不要留下未解决的 Bugbot 评论。swyx 说,在合并两三个改动、之后又发现 Bugbot 早已警告过完全相同的缺陷后,“你会学会等 Bugbot”。
并行产出意味着,10人初创公司可能需要“过去1万人公司才需要的 DevEx 和流水线”:分阶段和渐进式发布、自动回归检查、堆叠式 diff 以及合并队列。swyx 在这场讨论中提到了 Graphite;Alessio Fanelli 表示,Cursor 的目标是端到端的软件创建体验。
7. “盒中大脑”是持久且有主张的基础设施
用户目前还不能选择 VM 规格,但 Cursor 计划提供类似 EC2 的选项菜单。默认环境通过运行安装命令并对 Linux 文件系统做快照来构建;更长期的桌面环境还应休眠内存,让打开的浏览器页面在数天后重新唤醒时仍然存在。
团队此前曾通过端口转发暴露本地浏览器 iframe,实际上是在隧道化 VM 的 localhost。后来他们撤下了这一界面,因为远程桌面的延迟已经足够低,并且能够处理原生文件上传等浏览器访问无法覆盖的通用任务。
Cursor 也测试并移除了一个文件应用。团队认为,限制直接编辑反而能推动理想的委托模式:Agent 和用户共享桌面、终端这些原语,但 Cursor Web 不会把人重新引回逐个文件进行“手写代码”的日常流程。
这种缺失是有意为之,并非永久如此。Alessio Fanelli 表示,Cursor 最终希望用户在高层工作,需要时再“下钻”到最低层;同时他也承认,Slack 这类受约束的界面之所以更干净,恰恰是因为它没有重新创造一个完整编辑器。
8. Cursor 暂时不会接管部署
swyx 将 Cursor 与 Lovable、Bolt 作了对比:后两者从云端起步,掌握部署和日志,因此可以闭合调试循环。他指出,大约50%的应用使用 Vercel、Next.js、Tailwind 和 React,这让建立一个
cursorapps.com托管层显得很有诱惑力。Cursor 团队基本接受了这套逻辑,但认为托管并不是今天最重要的瓶颈。Datadog MCP 等现有集成可以暴露生产环境状态,而 Cursor 当前的优先级,是让生成的代码安全通过审查,并进入客户现有的基础设施。
现有企业软件也不同于从零到一的应用。说服 Shopify 这样的公司迁移部署,是一件更难的事,而且“可能永远不会发生”;这保留了 Cursor 跨技术栈工作的能力,代价是无法掌握完整的运维闭环。
9. 模型路由和跨供应商委员会可以击败单一赢家
随着前沿模型变化,Alessio Fanelli 的使用习惯也变了:他曾是“Opus 4.5 maximalist”,随后突然切换到 Codex 5.3。因此 Cursor 希望在为专家提供明确模型选择的同时,也为那些期待产品自行判断最佳模型的用户提供默认选项。
swyx 的“Agent 实验室”论点是,每家 Agent 公司最终都需要一个路由器。Cursor 已经在桌面编辑器里提供 Auto,并预计云端也会有对应版本,利用自身的流量、内部品味和经验,成为不想效忠某个模型的用户的“仲裁者”。
Best-of-N 是并行 Agent 的一个子集:多个模型在隔离的云端 VM 中接收同一提示词,避免本地 worktree 冲突和端口被杀掉。4段20秒的演示视频还可以判断,4份700行的 diff 则很难审查。swyx 认为,worktree 可能会逐步退出。
一项更激进、但尚未发布的实验,在这些候选结果之上增加了一个 Agent 式合成器。它不只是挑选赢家,而是从多个 Agent 中学习并写出新的 diff;跨供应商基础模型产生了“几乎像协同输出一样”的结果,这正是 Andrej 所称的“委员会”。
10. 子 Agent 管理上下文,Grind mode 将工作拉长到数天
演示中,父 Agent 可以使用通用任务界面:它可以创建1个或5个探索子 Agent,而不要求用户定义每个角色。内置 Worker 包括 Explore,即使父 Agent 使用 Opus,它也可以把探索任务路由给更快的模型。
计算机操作也是天然的子 Agent 边界,因为其轨迹包含大量图像和漫长的验证序列。它可以选择适合该任务的模型,再将整个运行过程压缩成最终消息,避免每个动作都污染父 Agent 的上下文。
长时运行模式在内部称为“Grind mode”,从规划开始,并在用户与 Agent 达成一致前拒绝执行。Cursor 发现,一个规格不充分的提示词运行3分钟或许还能接受,但一项真正可能运行3天的任务,就值得先进行充分规格定义。
实验性浏览器需要的吞吐量超过单个 Worker 的能力,因此 Cursor 构建了“一群 Worker 和规划器”。浏览器本身还没有准备好投入生产,但这次练习揭示了编排和并发如何改变可尝试的事情。
11. 胜负指标从延迟转向系统吞吐量
核心类比是工程中的延迟—吞吐量权衡:下一个解锁点不是让“水流得更快”,而是让“管道更宽”。并行 Agent、子 Agent 和 Agent swarm 可以倍增完成的工作量,即使每项任务本身并没有更快完成。
讨论将一个约100个 Agent 并发、每秒产出数千个 token 的系统称为“未来的一瞥”。同时还提到,当系统生成并推送大量代码时,GitHub Actions 已经不堪重负——相当于人们运行10倍数量的 Agent,使有效人手扩大了10倍。
2名开发者运行浏览器级别的 Agent swarm,将需要“令人难以置信”的推理量。Alessio Fanelli 表示,如果这些系统开始大规模产出具有经济价值的生产代码,即使是乐观的基础设施扩张预测,也可能低估需求。
定价进程与这种扩张相匹配:自动补全约每月20美元,本地迭代 Agent 数百美元,而正如 swyx 所说,并行、由 VM 支撑的工作如今每个人已经要花数千美元。随着杠杆继续提升,讨论认为价格“可能达到数万美元及更高”,其依据是杰文斯悖论,而不是消费减少。
12. 人类转向品味、编排和快速判断
一个典型的早晨,是一次性启动10个 Agent。每个 Agent 完成后,开发者花90至120秒观看视频、操作桌面、注入品味——“把它改成红色”——然后启动 CI,或把 Agent 退回去继续工作,再打开下一个线程。
云端执行把通勤、过夜和其他“死时间”变成生产力,因为笔记本不必保持打开。swyx 表示,他会在手机上使用 Web 界面审查视频,并解除 Agent 的阻塞。
招聘仍然看重基本功和快速判断,而不只是熟悉最新的 Agent 功能。无人看管的模型可能制造粗糙的抽象,因此 Cursor 仍然重视那些构建过系统、能识别好模式、会重构,并能在3个月内已经发生变化的环境中快速引导系统的人。
Alessio Fanelli 表示,他现在仍然手写的代码约占1%,并预测自己将在12月完全不再亲自写代码。剩下的是“纯粹的意图传递”:提示词反而更慢时进行的微小修改,以及那些“写作过程本身就是思考”的提示词和文字;语音编码仍受技术拼写和精确度限制。
13. 入职、记忆和自我认知决定云端迁移
Alessio Fanelli 预计,云端 Agent 将在年底前超过本地 Agent,并在年底前达到其2倍以上的使用量,同时警告,这一交叉点会“比人们想的更久,也比我们想的更久”。沙盒仍然太慢,而且很难可靠配置。
环境配置不是一次性、也不是永久性的:依赖会变化,数据库会迁移,Agent 也会需要新的系统和密钥。除了安装仓库,它们还必须学会特定命令、后端状态检查、设计取舍,以及定义该代码库“如何成为一名好开发者”的各种细节。
Alessio Fanelli 对记忆的看法已经转向动态文件上下文——指针、注释和半永久文件。更广泛地说,记忆是自我审计能力的子集:Agent 应该识别缺失的知识、相互冲突的规则或技能,以及 DevEx 失败,然后提出注释、链接或记忆文件来填补缺口。
这里的自我认知,指的是理解运行环境,而不是意识。产品可能具备某项能力,却错误地告诉用户自己做不到;更难的前沿,是让 Agent 理解自身限制,并恰当地调整上下文或运行设置。swyx 预计,其他行业最终也会经历软件行业目前正在显现的同样杠杆效应和角色变化。