
Sherwin Wu
前沿洞察
OpenAI正以8亿周活与广泛API为底座,通过Apps SDK与AgentKit将ChatGPT全面升维为超级分发与应用层。其战略内核是用前沿工程与RFT(强化微调)把企业交付反哺为研发基建,将竞争焦点从通用模型转向专有数据与受控智能体工作流。但关键警示在于:推理延迟、算力成本与治理SLO已成生死线,能否兼顾质量与效率才是终极护城河。
观点集合
OpenAI 如何服务每周8亿用户:模型专业化与微调
- 🗓️ 日期:
2025-11-28| 🎙️ 节目:The a16z Show
OpenAI将约8亿周活ChatGPT与广泛API分发结合,模型偏好和开发者调优也带来出人意料的高留存。专业化模型、强化学习微调和受控智能体工作流扩大变现机会,但推理效率与企业治理仍是关键运营护城河。
查看访谈对话精读提要
OpenAI 的分发策略刻意采取双线并行:ChatGPT 每周触达约8亿用户,而 API 通过第三方产品触达的人群可能更广。 Sherwin Wu 表示,这是创始人一贯要求将 AI 的收益尽可能分发到更多场景的结果,尽管客户反复担心 ChatGPT 会进入自己的市场。按当前增速,第一方产品本身已形成巨大势能,内部竞争焦虑相对有限:“全球每周有10%的人在使用它。”
模型之所以异常抗拒商品化,是因为用户和开发者都会形成对特定模型的依赖。 用户会在 GPT-5、GPT-4o 和 o3 之间形成偏好;开发者则不断调优提示词、工具和应用框架,最终事实上变成“围绕模型构建产品”。两者叠加,带来出人意料的高 API 留存率,也削弱了应用抽象掉底层供应商这一经典平台风险。
OpenAI 已从“一个模型统治一切”的预期,转向越来越相信市场会容纳一组专业化模型。 Cursor 展示了正在成形的技术栈:用 Max 模式下的 GPT-5 做规划,用 Composer 快速完成首轮处理,再用其他模型解决深层 bug 或代码补全。Sherwin 预计“还会涌现大量其他类型的模型”,但也提醒今天的判断可能再次改变;专业化并非偏离 AGI,而是说明通往 AGI 的路径比此前设想的更难预测。
强化学习微调能把企业专有数据从检索资产,转化为可能具备差异化的模型能力。 早期监督式微调主要带来“指令遵循 plus”和语气变化;RFT 则可能为客户的狭窄使用场景打造业界领先模型。OpenAI 正在试点为愿意分享高价值数据集的客户提供折扣推理,甚至免费训练——这本质上是围绕企业内部“巨大数据宝藏”的一次明确交换。
应用层的瓶颈已从巧妙设计提示词,转向上下文工程和受控编排。 更强的推理模型仍需要正确的工具、数据、检索时机和流程边界;Martin Casado 的归谬是,经典 RAG 用余弦相似度决定向“一台超级智能”输入什么。对企业而言,智能并不会消除工作流结构:许多岗位需要确定性的 SOP、获批准的回复目录,以及对 agent 可执行范围的强制限制。
OpenAI 将 agent 视为通过不同界面表达的智能,而不是一个独立产品类别。 ChatGPT、Codex、Sora 和 API 都是同一核心智能的“不同界面和不同部署方式”;Codex 之所以独立,是因为 CLI 比 ChatGPT 更适合编程。这也给了创业公司嵌入 Codex 或围绕 Codex 构建产品的空间,Casado 开玩笑称之为“token laundering”经济:把自然语言输入转化为按量计费的智能。
按用量计费的 API 定价之所以站得住脚,是因为它与消费量直接对应,支持成本加成的利润纪律,而且可能已经近似于按结果定价。 OpenAI 将用量定价视为一种可能的“单向棘轮”:客户一旦开始按更接近实际效用的方式付费,部署式定价就很难恢复。按结果收费在作物产量等领域仍很有吸引力但难以执行;Martin 认为,随着任务难度和价值上升,测试时算力也会增加,token 用量可能成为结果的可行代理指标。
开放权重看起来是在扩大市场,而非蚕食既有业务;高效推理仍是一道有意义的运营护城河。 Sherwin 表示,OpenAI “完全没有看到蚕食”,因为 gpt-oss 的客户和使用场景与主要托管模型不同。即使假设 GPT-5 的权重公开,也无法复现 OpenAI 的线上服务表现:其最大的2到3个模型获得高度集中的资源,推理和训练团队则协同优化。多模态能力同样依赖专业化技术栈——共享 API 基础设施之下,是彼此独立的文本、图像和视频推理系统。
🔗 原始收听与视频来源: OpenAI 如何服务每周8亿用户:模型专业化与微调
DevDay 2025:Apps SDK、Agent Kit、MCP、Codex,以及为什么 Prompting 比以往任何时候都更重要
- 🗓️ 日期:
2025-10-07| 🎙️ 节目:Latent Space
Apps SDK 正将 ChatGPT 变成应用与分发层,连接约8亿周活用户和400万开发者,同时让品牌掌控体验。MCP、AgentKit、评测与提示词优化推动生产级编排,但 ChatKit 的身份和推理成本仍未定型;Codex 与组织级 SLO 则把效率和可靠性推向前台。
查看访谈对话精读提要
Apps SDK 正在把 ChatGPT 从附着于其他产品的聊天机器人,变成这些产品运行其中的分发层。 OpenAI 披露开发者数量已达400万,Sherwin Wu 回忆 ChatGPT 每周活跃用户约8亿,称其规模约相当于全球第五或第六大网站。插件时代的教训是,只有分发还不够:开发者必须“真正拥有并掌控体验”,包括界面和品牌。
OpenAI 采用了已经开始形成的通用协议 MCP。 Sherwin 认为 Anthropic 真正把 MCP 做成了开放协议,包括让 OpenAI 参与其指导委员会;讨论显示,MCP 大约在3月与 Agents SDK 和 Responses API 同步获得采用。尚未解决的是连接器质量:第一方同步连接器可以实现索引和重排,第三方 MCP server 覆盖长尾需求,但性能取决于各创建者的 API 形态。
AgentKit 正在从又一个 agent 演示框架,变成端到端的生产平台。 Agent Builder、Agents SDK、Connector Registry、ChatKit 和评测工具把可视化工作流设计、部署、测试与优化串成一体;Christina Huang 在8分钟的演示时段内搭建了一个可运行的 DevDay 助手。更深层的机会在于复杂编排——涵盖“持续数周”的人工决策、可复用的企业模板,以及未来从画布走向代码、再由代码回到画布。
Agent 评测仍处于早期,但优化单位正从单个答案转向完整轨迹。 Christina 估计,OpenAI 目前只完成了“所需进展的大约10%”:现有系统可以评估长轨迹,但评测一个20分钟的任务,需要拆解并改进其中的单个步骤,而且往往需要人工复核。通过接入 OpenRouter,评测产品还可以在同一处比较非 OpenAI 模型和开源模型。
Prompting 正在成为持久的生产资产,实质上是一种“零梯度”微调,而不是随着模型进步消失。 OpenAI 围绕 GPT-5 推出了大规模自动提示词优化功能,因为每个模型都有新的行为特征,并计划把提示词、agents 和评测反馈接入持续生成改进建议的闭环。Sherwin 明确改变了此前的判断:人们曾以为“prompting 要消失了。不”;但它实际上已经“越来越根深蒂固”。
ChatKit 减少了前端工作,但身份体系、推理成本承担方式和 widget 生态仍未定型。 它的常驻 iframe 和 widgets 借鉴 Stripe Elements 或 Checkout 的理念:OpenAI 维护新的推理能力和多模态 UX,开发者负责定制应用本身。当前不支持自带 key,复制粘贴 key 是“巨大的安全隐患”;即使推理价格下降,总支出也可能上升,因为需求增长更快。
Codex 已在压缩开发周期,而 API 可靠性正成为一项可见的产品承诺。 Christina 说实习生会以“完全 YOLO 模式”使用 Codex,宽泛任务约有30%–40%的概率一次完成;可视化 Agent Builder 在发布前不到2个月才启动,“没有 Codex 不可能做到”,但人类仍会复核其工作。在服务规模上,OpenAI 已超过此前提到的每分钟60亿 tokens,并开始披露组织级吞吐量和错误 SLO;从三个9到五个9的路径,需要“指数级更多的工作”。
🔗 原始收听与视频来源: DevDay 2025:Apps SDK、Agent Kit、MCP、Codex,以及为什么 Prompting 比以往任何时候都更重要
OpenAI企业业务内部:前沿部署工程、GPT-5及更多 | BG2嘉宾访谈
- 🗓️ 日期:
2025-09-11| 🎙️ 节目:BG2
OpenAI 通过前沿部署工程师、评测和虎队,把企业部署变成分发渠道与模型研发基础设施。RFT 将价值从模型定制转向专有数据能力提升,但推理质量与延迟仍存在取舍。
查看访谈对话精读提要
OpenAI的企业业务早于ChatGPT——“OpenAI最初真正的产品并不是ChatGPT,而是B2B产品,也就是API”——如今公司还在运行一种Palantir式的前沿部署工程师模式,将工程师嵌入T-Mobile(由OpenAI模型实时处理语音客服)、Amgen(GPT-5在药物开发文书领域的头部客户)和Los Alamos(将o3物理部署到与Lawrence Livermore、Sandia共享的气隙Venado超级计算机上)等客户。
面对MIT“95%的AI部署都无法奏效”的标题,Olivier从约200次企业部署中总结出的规律是:自上而下的支持加上自下而上的“虎队”,并且先做评测;“客户拿不出好的评测时,目标就一直在移动。” 企业知识大多存在于“人的脑子里”,而不是SOP中,从46%爬升到99%是“艺术,有时甚至更像艺术而非科学”。
本期最锋利的判断是:尽管安全门槛更高,2025年的“物理自主性领先于数字自主性”。 因为自动驾驶有10-15年时间,以及道路、红绿灯等脚手架;而“AI agent就像被直接丢在荒郊野外”。Agent只诞生于o1-preview的推理范式,而“我认为这条斜率陡得惊人”;按收入计算,它们可能已经越过Waymo。
GPT-5的差异化在于“工艺——模型的风格、语气和行为”,而不是已经饱和的基准测试。 一位主持人称,某项评测显示幻觉“基本降到了零”;尚未解决的核心取舍是推理token与延迟——GPT-5 Pro能“一次解决”过去无法解决的问题,但需要等待10分钟。反直觉的教训是:指令遵循变得过于字面,旧式“请保持简洁”的提示词反而让输出失灵。
强化微调(RFT)——Olivier说这是OpenAI创造的术语——比SFT“强一个数量级”,也把推介重点从定制模型转向利用专有数据打造“世界上最好的模型”(金融服务领域的Rogo、在TaxBench上达到SOTA的Accordance)。 Olivier的判断是:在前沿能力上,“RFT基本会成为行业常态”。
多空交易上,Sherwin做空“围绕AI产品的整个工具链”——评测产品、框架、向量数据库,以及如今的RL环境创业公司——因为技术栈迭代太快,抽象层很难跨越一代模型存活。 Olivier做空以记忆为核心的教育(“知识token”),做多医疗——“可能是最受益于AI的行业”。
值得记录的软信号包括:即便工程师人数的含义仍不明确,未来仍将需要多得多的软件工程;“世界上存在巨大的软件短缺”(OpenAI的产品经理如今直接交付写好的原型,而不是PRD);Codex CLI与GPT-5的使用正在加速;而“那次插曲”(董事会政变)让OpenAI变得反脆弱——“更抗打,也能更快恢复”。
🔗 原始收听与视频来源: OpenAI企业业务内部:前沿部署工程、GPT-5及更多 | BG2嘉宾访谈