Open AI Insider 谈 GPT-5、AGI 与伟大的 AI 竞赛:Kevin Weil 与 Dave Blundin
摘要
GPT-5 被定位为 OpenAI 将前沿能力合并进一款广泛适用产品的尝试,但访谈并未解决 AGI 问题。 Kevin Weil 称其为 OpenAI 最聪明的模型,重点强调编程、健康、复杂指令执行、工具调用和智能体工作;定价不到上一代的一半。但 OpenAI 仍无法可靠预测模型会解锁什么能力:能力会“穿过迷雾”出现,有时甚至要到发布后才显现。
OpenAI 的硬约束不是客户需求,而是算力。 Weil 表示,公司使用的模型配置基本与客户相同,始终“完全满负荷”,每新增一块 GPU 都能立即找到用途——降低延迟、加快 token 生成、扩大产品覆盖,或增加研究实验。因此,Stargate 计划投入超过 5000亿美元的基础设施,本质上是在扩充产能,以满足他所称的“墙内对 GPU 基本无限的需求”。
OpenAI 的分发策略颠覆了传统软件变现:昂贵能力先进入付费层,再逐步向免费层迁移。 Deep Research 从 Pro 下放到 Plus,最终向免费用户开放有限额度;印度推出了大幅折价的套餐,用量约为免费账户的 10x。Diamandis 表示,如今模型价格约为 GPT-4 发布时的 1/100,智能水平却在提升;Weil 则称,计算量最密集的任务仍将保留在付费层。
创业公司的检验标准,是更强的基础模型会强化产品,还是直接抹去产品。 Weil 建议创业者围绕当前模型已经显露出“微弱希望之光”的领域构建,让下一代模型到来后应用“唱起来”,而不是修补 OpenAI 很快就可能消除的限制。他的判断范围很大:几乎所有已经规模化的产品、服务和设备都诞生于 AI 之前,“它们都将被重新发明”。
OpenAI 构想中的 AGI 产品是环境式、主动式的,并能生成一次性软件,而不只是一个更聪明的聊天窗口。 Weil 预计界面会实时生成,例行工作会在用户开口前完成,助手能够“看到你所看到的”,并持续“在后台不断运转”。访谈中关于 Jony Ive 的问题,因录制中断而未获回答。
推理为预训练之外增加了第二条扩展轴:模型能够持续工作多久,同时保持方向不偏。 ChatGPT 的推理可能运行约 60秒,Deep Research 则可运行 20–30分钟;但 Weil 看不到模型不能工作数天、数月甚至数年的理由,“模型思考得越久,就越聪明”。芯片布局这类定义清晰的问题尤其适合把算力转化为迭代收益,因为每个候选设计都可以被评分。
AGI 可能以不断上升的能力梯度到来,而不是一次清晰的阈值事件。 Weil 认为,如今的模型已经在某些领域超过他,在另一些领域仍明显不如他,但“水位正在上升”;主持人将这一转变比作社会几乎没有察觉 AI 已经通过图灵测试。衡量重点正从容易评分且趋于饱和的基准测试,转向模糊但具有经济价值的工作。
在日益自动化的经济中,人类的对冲项是目标感、私人连接,以及把模型部署进具有实际后果的机构。 Weil 否定了人们只需“吃葡萄、写诗、领取 UBI”的未来,认为节省下来的时间会被重新投入更大的目标,而面对面连接的重要性会进一步上升。他同时担任陆军中校,也体现了本集更广泛的部署判断:如果竞争对手把较弱的系统部署到各处,而更强的模型“只是放在货架上”,那就没有多少优势。
精读
1. GPT-5 用广度、价格与可用性取代炫技
Weil 称 GPT-5 可能是“有史以来最受期待的 AI 发布”,但他强调的核心是广度:OpenAI 最聪明的模型、强大的编程系统,以及能够执行复杂指令链、调用大量工具、接入服务并完成智能体任务,同时“不会忘记主线”的模型。
健康领域获得了异常多的产品关注,因为用户已经把从孩子突然出现的症状到癌症诊断及相关数据的一切都带给 ChatGPT。Weil 明确划定边界:“它不能取代医生”,但一个能够全天候对话的强大系统,仍能帮助人们梳理信息。
Diamandis 认为,外界期待的是 AGI 现身,最终交付的却是一套更有用的统一系统,价格不到此前的一半。主持人将其单一产品的简洁性比作最初的 Google 搜索框——对于用途本就难以解释的技术,这是重要的界面优势。
OpenAI 自己也无法提前知道模型完整的能力边界。研究人员可能会看到模型“穿过迷雾”而来,但 Weil 表示,涌现能力可能在开发过程中令团队意外,甚至要等数亿用户以未预料的方式测试后才显现。
2. 7亿用户让发布日成为真正的评测
内部和外部测试都无法复现模型触达 7亿人后会发生什么。因此,OpenAI 会综合 Reddit、Twitter、LinkedIn、客户支持、朋友反馈和使用数据;这些数据表明,GPT-5 发布前后 Plus 升级出现了公司历史上最大的一波增长。
商业表现强劲,并不意味着产品没有失误。Weil 承认 GPT-5 初始版本的性格“有一点木讷”,团队很快发布了更温暖的版本——这说明部署本身是持续的产品开发,而不是发布即终点。
主持人认为,语音已经跨过了一个质变门槛:用户不再只聊一两分钟就结束,而是可以在开车途中连续交流数小时。Weil 的孩子把与 ChatGPT 进行 20分钟语音对话视为完全正常,这说明界面预期可以多么迅速地重置。
更大的不确定性并不只在性格。Weil 否认 OpenAI 内部有人确切知道 3个月或 1年后会有什么:研究想法可能开始奏效,但这些能力究竟能实现什么,只有当模型与产品结合后才会逐渐清晰。
3. 迭代式部署让免费访问成为终点
Weil 否认 OpenAI 按照某种秘密时间表逐步释放成熟能力。公司的使命指向“迭代开发、迭代部署”:系统准备好后,在通过安全检查的前提下尽快发布,让用户构建应用、暴露短板,再把这些经验反馈给下一代模型。
内部系统领先于公共产品,但 Weil 将其定义为研发,而不是被战略性扣留的成品智能。OpenAI 宁愿提前发布,也不愿等到把某种能力“完整成型后再赐予世界”,因为外部实验本身就是掌握能力的一部分。
变现路径与传统软件相反。功能一开始进入 Pro 或每月 $20 的 Plus 层,是因为成本高;随后 OpenAI 会努力把它向外扩散。Deep Research 先进入 Pro,再进入 Plus,最终向免费用户提供每月额度。
Weil 认为,免费分发与高端经济模型可以并存。OpenAI 会最大化免费提供的有用智能,但计算密集型、价值越来越高的任务仍将收费——尤其是在 ChatGPT 从等待提示的被动系统,转向用户睡觉时也能主动工作的系统之后。
4. 印度是智能成为大众基础设施的最清晰试验场
印度对 OpenAI 的重要性不只是市场规模,还在于其年轻人口和巨大的潜在创造能力。Weil 描述了开发者和 API 客户的强劲参与度,Diamandis 则强调印度 14亿人口,以及教育、医疗和治理领域的潜在应用。
Weil 的软件判断从全球目前约 3000万名能够编程的人开始。AI 编程模型可能把有效的软件创造能力扩展到 3亿人,最终扩展到 30亿人;他认为,每一次这种通用能力可及性提升一个数量级,都会改变世界。
访谈当天上午,OpenAI 推出印度专属付费层,价格远低于标准套餐,访问量约为免费账户的 10x。折扣体现了普惠使命,但 Weil 也没有回避约束:GPU 需要成本,而且仍然稀缺。
面对各国关于“主权 AI”的问题,Weil 回到访问成本下降这一点:ChatGPT 可以在手机上免费使用,甚至无需登录;Diamandis 表示,如今的智能价格约为 GPT-4 发布时的 1/100。Weil 认可这条更广泛的成本曲线,但没有展开另一套主权架构。
5. 竞争加速 OpenAI,但聚焦是其自称的护城河
Weil 直言 Google 是快速推进、能够构建好模型的竞争对手,此外还有 Anthropic 和“一大批其他玩家”。竞争有利于消费者和企业,也促使 OpenAI 加快行动;正如他转述一位朋友的格言:“资本主义战无不胜。”
OpenAI 会关注竞争产品,因为“墙内有聪明人,墙外有更多聪明人”。竞争对手的功能、客户需求和实际使用情况都会成为输入,但 Weil 表示,决定性变量仍是围绕清晰 AGI 使命的内部执行力。
Diamandis 提到 Google 约 1000亿美元的自由现金流、长期基础设施积累和庞大数据中心,认为这些构成 OpenAI 的结构性劣势。Weil 的反驳是聚焦:Google 支持许多产品,而 OpenAI 只有“一个产品”和“一个使命”;构建 AGI 是生死攸关的事业,不是众多项目中的一个。
6. 创业者应为下一代模型构建,而不是防御下一代模型
Weil 对机会地图的判断从一次重置开始:几乎所有规模化运行的产品、服务和设备都诞生于 AI 之前。给它们加上 AI,就像给机械系统接入电力;历史表明,许多在位者无法亲自完成这次重造。
OpenAI 会参与这场重建,但不可能覆盖医疗、材料科学、技术及其他所有行业。因此,即使模型提供商横向扩张,创业公司仍拥有巨大的切入空间。
最好的位置在模型前沿:应用勉强能够运行,创业者已经看见“微弱的希望之光”。如果 2个月后新模型到来,让这项脆弱能力“唱起来”,说明应用顺应了进步,而不是暴露在进步之下。
最危险的位置,是价值只来自修补当前模型缺陷的包装层。Weil 的直接测试是:如果下一次 OpenAI 发布会“消除你正在构建的东西的必要性”,就不要构建它。Diamandis 将其与 Perplexity 创始人 Aravind Srinivas 提出的“AI complete”联系起来:乘上能力浪潮,而不是被浪潮淹没。
7. AGI 界面将由模型生成、无处不在,并可能延伸至神经层面
聊天之所以强大,是因为它接近人类沟通的通用性——写作、说话以及交换视觉上下文——但 Weil 不认为它会是唯一的 AGI 界面。足够强大的模型应当能够实时为每项任务生成最经济的 UI。
讨论进一步延伸到短命软件:可以为眼前需求创建专用工具,用完即弃,因为重新生成它只需瞬间。实时图像和视频生成也可以用来展示设计、搭建场景,或围绕用户制作娱乐内容。
Weil 更喜欢《安德的游戏》中“耳边的宝石”这一比喻:一种能够看到用户所看到的、听到用户所听到的,并访问广泛信息的智能。ChatGPT 不应被困在某个应用里;只要用户赋予它上下文,它就应当“在后台持续不断地运转”,采取行动并节省时间。
BCI 引发了真正的分歧。Weil 起初认为,AI 发展速度已经太快,额外的输入带宽并不重要;Diamandis 则认为视觉和神经接入仍可能有所帮助。Weil 后来表示自己愿意使用 BCI,双方也都将这一兴趣限定在安全性问题上。尚未解决的问题是:神经接入究竟会扩展认知,还是只会加速一个人类本已难以消化的界面。
8. 自动化提升共享文化、实体存在与目标感的价值
AI 生成的媒体很可能高度个性化,电影甚至可以只为单个观众制作。Weil 保留了其中的权衡:个性化内容很有吸引力,但社会会失去所有人观看同一条新闻或同一部院线电影的共同体验;在另一端,明确由人类创作的作品可能更有价值。
主持人提出,虚拟世界可能以“曲速”变化,而实体基础设施变化更慢。Weil 认为不变的是人性:面对面工作、手写笔记和私人连接仍然重要,而且在数字生产变得充裕后可能更加重要。
目标感是 Weil 所说“星际迷航宇宙”与“疯狂的麦克斯宇宙”的分界线。他否定人们坐下来“吃葡萄、写诗、领取 UBI”的图景;过去节省劳动力的工具没有消灭雄心,AI 应当把节省下来的时间重新投入更有趣的工作。
80亿人中的每一个人,每周仍有 7天、每天 24小时、每年 365天。Diamandis 称 AI 是最伟大的时间倍增器;Weil 的推论是,人类追求更大目标、让世界变得更好的驱动力“不会改变”,AI 只能把它进一步放大。
9. OpenAI 的运营优势在于紧密的研究到产品闭环
Weil 粗略估计,研究组织规模为“几百人”。其工作横跨高度学术化、可能失败或数年不为人知的实验,紧贴客户需求的后训练,以及两者之间的所有环节。
在他的描述中,OpenAI 的独特机制是研究、工程与产品之间的循环:创造一种能力,将其变成产品,收集反馈,再把证据送回模型开发。Deep Research 和智能体功能都源于这一模式。
责任并不集中在 CPO 角色:Weil 负责 ChatGPT 和 API 等产品;Mark 负责研究;Greg 负责数据中心基础设施和扩展。他还强调共同办公和白板讨论,因为公司仍然保持着“一种非常研究导向的文化”。
Weil 本科背景是物理学,Sam 曾把他介绍给聚变领域的公司,他一度差点加入一家聚变公司。后来他将此前的雇主与 OpenAI 对比:据他经验,Facebook 和 Instagram 已经运行很快,但“我过去的经历中没有任何事情能与 OpenAI 相比”。
10. 基准测试饱和后,AGI 衡量转向混乱的经济工作
传统 AI 基准如今“几乎全部饱和”,迫使研究人员转向 FrontierMath 和 ARC-AGI 等更难的测试。饱和说明模型仍在进步,但也让原本能够清晰呈现进步的简单标尺失效。
OpenAI 越来越多地评估与经济价值相关的任务:解读健康案例、搭建公司财务模型,或完成医生、律师和银行家相关的工作。这些任务接近 AGI 的一种定义——执行具有经济价值的任务——但没有唯一标准答案。
能力越广,评分问题越大。数学相对容易评分;财务模型可以用多种有效方式构建,创意写作则没有唯一正确答案。模型正在进入这些真正有用的领域,而在这些领域,评估会变得更“柔软”,自我改进也更难监督。
主持人指出,AI 通过图灵测试时几乎没有仪式感,尽管这一里程碑已经存在了 50或60年。Weil 预计 AGI 也会以类似的渐进方式到来:模型已经在某些方面远比他聪明,在另一些方面却明显更弱,但“水位正在上升”。Diamandis 引用了 GPT-5 Pro 接近 148 的 IQ 测量结果;他还表示 GPT-5 赢得了 IMO 金牌,而 Weil 提到它在一项编程竞赛中获得第二名。
11. 混乱的模型名称,是提前发布能力的副作用
Weil 接受了外界对产品目录的“理应受到的批评”:其中同时存在 o4-mini 和 4o-mini。混乱源于迭代式部署:OpenAI 更愿意尽快发布一个专业化突破,而不是等到所有能力都能塞进一个优雅的通用产品。
GPT-4o 引入了更广泛的交互能力,包括语音;独立的 o1 系列引入了推理——提出假设、拒绝失败方案,并继续尝试,而不是立即回答。早期推理模型擅长艰难的科学问题,但未必适合关系建议或日常事实问答。
专业化让 OpenAI 能更快观察推理有效的场景、用户尝试做什么,以及模型在哪些地方失败。GPT-5 成为 OpenAI 将这些分支重新合并为一种体验的节点,但 Weil 预计,未来仍会先出现实验性分支,再在公司理解它们后重新整合。
推理也创造了第二条智能扩展轴。预训练仍是一条轴;测试时算力则关注模型能够思考多久,同时保持连贯。借助 o1、o3 和 ChatGPT,模型可能思考约 60秒;Deep Research 则可以花 20–30分钟收集信息、识别缺口,再返回寻找更多证据。
12. 闭环芯片设计可以把更多算力转化为更多算力
Weil 看不到模型不能工作 2天、2个月或 2年的理由。Andrew Wiles 没有在 5分钟内解决费马大定理——他花了 7年;OpenAI 仍在持续看到更长时间的推理能够带来更难问题的解法。
芯片设计尤其适合这一机制,因为它受到约束且容易评分。系统可以提出布局、进行仿真、评估芯片速度,然后迭代;这就形成了开放式创意领域所缺少的评测闭环。
主持人认为,AI 还可以把算法意图翻译成硬件,缩短模型团队与芯片团队之间的组织距离。Weil 表示,OpenAI 正在设计自己的芯片,使用 AI 改进设计和布局,并与制造合作伙伴协作。
他关于定义清晰问题最激进的条件性判断是:对重复评分的迭代施加任意算力,就“到目前为止”可以预期任意改进。他仍认为这一领域对技术实力强的创业公司非常开放,材料科学也是同一机制下被低估的领域。
13. 教育应利用 AI 提高作业难度,再把目标推向前沿
Diamandis 反对学校禁止 AI,因为学生毕业后会在任何地方使用它。他提出的重设计是:不要再布置 AI 已经让其失去意义的八年级作业,而应让八年级学生在 AI 支持下挑战研究生级问题,例如设计一艘星舰。
Weil 表示认同:假设 ChatGPT 已经存在,教学生使用它,让他们走得比传统课堂更深,并提高对最终成果的要求。他引用 Ethan Mollick 的《Co-Intelligence》,以及 Mollick 围绕 AI 普及使用重构课程、而不是假装 AI 不存在的做法。
即使进步停留在 GPT-5,Weil 也相信现有能力将在未来 10年改变社会;但进步不太可能停滞。Diamandis 将这一前提延伸到太空、能源和科学等宏大挑战,认为普及后的工具能让人们追求过去只有国王、女王和强大资本家才能开展的使命。
Diamandis 给出了自己的条件性前沿预测:到 2026年底 Starship 往返月球成为常态,或者“肯定”在 2027年实现;约 2030年让机器人登陆火星;Helion 的目标是 2028年,CFS 则约为 2030年。Weil 更广泛的观点是,密集创业集群与 AI 赋能创业者之间的竞争,会提高这些宏大项目成功的概率。
14. 无论国防还是创业,部署都胜过把智能放在货架上
Weil 表示,他于 6月13日以陆军中校身份入伍,当天同行的还有 Palantir 的 Shyam Sankar、Meta CTO Boz,以及 OpenAI 前研究负责人 Bob McGrew。该项目旨在通过结合产业经验与机构知识,拉近技术与国防部之间的距离。
Diamandis 认为,穿上军装意味着他们成为机构的一部分,而不再是外部顾问。Weil 认同,身处机构内部应让他们更有效率;他们的工作比传统预备役安排更临时,采用按需知悉的分隔机制,并通过划分重点领域来管理利益冲突。Weil 预计自己会部分专注于利用 AI 监测和改善身体表现。
战略问题在于整合速度:“如果我们拥有世界上最好的模型,却只是把它们放在货架上”,而 PLA 使用较弱的模型、却把它们部署到各处,那对我们“没有任何好处”。这句话呼应了本集更广泛的迭代部署逻辑——可用系统与反馈闭环,比潜在能力更重要。
Weil 给创业者的最后建议是“以一切可能的方式拥抱 AI”,并假设陡峭的增长曲线会继续。想象那些应该存在、但目前还无法构建的东西,再朝着 6个月、1年或 2年后可能到来的能力前进;用他绝对化的说法,面向未来构建的创业者会受益,因为“模型终将抵达那里”。