AIE Europe 复盘 + Agent Labs 论点:Unsupervised Learning × Latent Space 交叉特别篇(2026)
摘要
AI 编程在1年内成为一个数十亿美元市场,swyx认为,顺势下注仍比假设相邻用例必然追上更安全。 他援引的数据是:Anthropic 的 Claude Code ARR 约为25亿美元,OpenAI 估计约20亿美元,Cursor 据传也接近20亿美元。编程的占比从约10%升至50%,所以问题是“为什么不能继续增长”,而不是回归均值。
更可能的市场格局是2家大型编程玩家加一批专业化长尾;应用公司靠聚焦和企业落地能力,而不是永久性的模型优势来构筑防线。 Cursor 和 Cognition 可以继续专注编程,而基础模型实验室则追逐金融、医疗和消费级 Agent 等更大的 TAM。更大的判断是:“2025年是 coding agents 之年,2026年是 coding agents 突破编程边界、去做其他一切的年份。”
Harness 工程看起来更接近共识,但更具决定性的 go-to-market 转变是,Agent 本身正在成为客户。 Skills 已经收敛到一个极简组合——一个 Markdown 文件加几段脚本;据称,Vercel 用于配置 Vercel 应用的管理后台,有60%的流量来自机器人。“如果它不存在一个 Agent 能调用的 API,它就不存在”;默认推荐也可能把市场从20个名字压缩到3个。
Agent Lab 的打法是把专有工作负载转化为更小的领域模型;即使前沿模型质量持续提升,成本和延迟仍是训练模型的持久理由。 据称,Composer 2 和 Sweet 1.6 在没有补贴的模型切换用户中都位列前5选择,定制搜索模型则展现出更明确的领域价值。替代芯片可能进一步强化这套经济性:swyx 对比了每秒数千 token 和不到100 token 的差距,并认为“每次10倍提升,都会解锁一种不同的使用模式”。
基础模型发布对中型初创公司和低 NPS SaaS 的威胁,可能大于对小团队的威胁;后者即便产品失败,也可能把它变成进入模型实验室的面试作品。 swyx 的亲身测试案例,是用他认为约2000美元就能做出来的产品,替代每年20万美元的活动和赞助商管理软件。真正的约束在组织层面:高管周末做出的“80%解决方案”,可能让其他人负责维护“剩下那堆破事”。
编程前沿已经从“人类写代码归零”推进到“人类审代码归零”,自动化验证成为“暗工厂”能够运转的闸门基础设施。 swyx 预计,一次性软件的规模最终会改善质量,同时警告赢家不会是那些把一切都斥为垃圾产出的犬儒主义者:“这件事不管有没有我都会发生,那就让我们把它往正确方向掰。” Jeremie Harris 对临时性 post-training 的态度有所缓和,因为成果可能3个月后就失效;Jacob Effron 则强调:“结果可以扔掉,但原始数据不能。”
模型规模仍在上升,但记忆、上下文和有现实锚定的空间理解,可能比再刷出一次基准测试提升更难突破。 swyx 已放弃模型规模会封顶在约2万亿参数附近的判断,却称上下文是“扩展速度最慢的因素”:3年间从约4000 token 增至100万 token;Gemini 的百万 token 上下文已经存在2年,却几乎没有得到广泛使用。他借用《心灵捕手》的比喻:主角博学却缺乏人生经验,就像一个“什么都知道、却从未经历过任何事的 LLM”。
精读
上游暂未提供,后续同步将继续补齐。