Marc Andreessen 与 Amjad Masad 谈“够好”的 AI、AGI 与编程终结
摘要
Replit 的赌注是:英语终于成为编程语言,真正动手写程序的将是 agent,而不是人。 用户只需描述想法,agent 便会选择技术栈、配置基础设施、编写并测试软件,并能在大约 20–40 分钟内发布一个生产级应用。Masad 对 Replit 早期瓶颈的诊断非常直接:在抽象掉开发环境和部署之后,“最后一个需要被抽象掉的东西就是代码”。
Agent 的自主运行能力正在按数量级提升,但决定有用运行时长的不是模型原始智能,而是验证机制。 Masad 说,Replit 的 Agent 1 能运行约 2 分钟,Agent 2 能运行 20 分钟,Agent 3 能运行 200 分钟;部分用户会把运行时间推向 12 小时,但他对 2–3 小时最有把握。这套架构类似接力赛:一个 agent 工作,另一个在浏览器中测试,系统再把已完成的工作压缩成新的 prompt,启动下一条轨迹。
凡是能把成功压缩成“可验证的真或假”结果的领域,AI 进展就应当最快。 强化学习可以奖励通过测试的代码、通过检查的 Lean 证明、能够运行的优化 GPU kernel,或经得住验证的模拟;诊断、法律、医疗等“模糊”领域暂时无法提供同等规模化的反馈。因此,决定进展速度的是具体性,而非智力难度;代码、数学、物理、化学、基因组学、部分生物学和部分机器人领域将呈现最陡峭的进步曲线。
短期软件市场可能从 1个人使用 1个 copilot,转向 1个人指挥 5–10个并行 agent。 Masad 预计 Replit 的下一步是让用户同时启动功能开发、数据库重构、设计迭代等任务,再由 agents 合并结果。他最激进的判断是,普通人很快就能达到今天 Google 高级软件工程师的水平。
即使真正的通用智能迟迟不来,“功能性 AGI”也可能通过对经济活动进行穷尽式专业化而出现。 Masad 认为更深层的目标是高效持续学习:智能体被放入新环境后,应能快速学习,并将知识迁移到不同领域。但今天的模型仍需要为代码、生物、化学、法律等领域分别准备数据和强化学习环境,因此他对真正 AGI 的突破“有点悲观”,同时确信按行业逐一实现自动化,仍能吸收大量劳动力。
最大的战略风险是:具有经济价值的 AI 变成一个局部最优解,把资本从通用智能上引开。 由于当前系统已经“够好”,足以完成海量生产性工作,优化资源和“数不清的钱”可能继续流向现有范式的扩展,而不是解决持续学习问题。本期最尖锐的反转是“更差即更好”:商业成功反而可能减轻寻找更通用架构的压力。
GPT-5 强化了可验证推理,却没有带来同等程度的人类式理解跃升,暴露出人们对“进步”定义的分歧。 Masad 认为,在可验证领域之外,模型的边际回报正在下降;他希望 AI 能够就存在争议的事件展开推理,而不是简单训诫用户。Andreessen 没那么失望:GPT-5 Pro 加 Deep Research 和 Grok 4 Heavy 已经能够生成连贯的 30–40 页研究综合报告,他认为其水平接近世界一流,由此留下一个尚未解决的问题:卓越的综合能力是否已经算得上创造性智能。
精读
上游暂未提供,后续同步将继续补齐。