本周 AI:GPT-5 发布,4o 被撤回,Grok Imagine 走向社交化
摘要
GPT-5 的发布表明,基准测试实力并不能保证消费者偏好。 它在编程、调试、数学和医疗问题上更强,但用户想念 GPT-4o 富有表现力的个性——“把那个老玩具还给我们”。遭遇反弹后,据报道 Sam Altman 表示 GPT-4o 将回归付费用户。主持人认为,市场对有娱乐性、类似陪伴者的模型存在巨大需求,它们不必拥有最高 IQ。
Grok Imagine 的优势在于分发和延迟,而非前沿级输出质量。 图片“基本即时”生成,视频也很快到达;X 用户长按自己或他人的照片,就能将其制作成动画或编辑。这个紧密的社交闭环、对手机相册的调用,以及生成真人内容的意愿,可能让 Grok 成为社交原生 AI 创作的重要试验场。
OpenAI 的 GPT-5 直播重点展示医疗辅助,Justine 将其解读为从默许非适应症使用走向公开背书。 直播展示了一名癌症患者用 ChatGPT 解读文件、讨论治疗方案,同时强调 GPT-5 在由250多名医生参与构建的 HealthBench 上排名第一。Illinois 则走向相反方向,广泛限制没有持证监督的 AI 治疗;一些公司已暂停在当地开展新业务或关闭新用户注册,而主持人质疑,私人聊天实际上能否被监管。
Genie 3 将生成式视频从短片推进到按需出现的交互式世界。 用户可以在由文字、图片或 Veo 3 视频生成的场景中移动,既可能录制可控电影、加速专业游戏开发,也可能生成个人小游戏。更深层的基础设施机会,是为数字智能体和机器人批量生成 RL 环境;不过主持人指出,这套系统成本高,而且大概率运行缓慢。
ElevenLabs 的全版权音乐模型,瞄准把素材来源视为采购前提的买家。 制作生日歌或表情包配乐的消费者可能不在意训练数据来源,但广告主、影视工作室、游戏公司和其他企业在意。来自全版权数据的强劲输出,挑战了“高质量必然依赖法律争议性抓取”的假设。
Vibe coding 已验证需求,但安全性和用户分层仍未解决。 Olivia 用几小时做出一款把用户与 Jensen at NVIDIA 合成自拍的应用;约3,000人一夜之间使用,耗尽了她100美元的 API 预算,但随后有外部人士发现 API key 暴露、用户上传照片的存储保护不足。她表示问题已经修复。主持人预计,今天“什么都服务所有人”的平台最终会分裂成有安全护栏的消费级工具,以及高度可配置的企业级产品。
精读
1. Grok Imagine 把 AI 生成变成社交动作
Grok Imagine 已通过 Grok app 提供服务,网页版即将上线,同时嵌入 X:长按一张已发布的照片——无论是自己的还是别人的——即可编辑,或将其制作成视频动画。
主持人明确提醒,Grok Imagine “不是最强的”图片或视频模型,音频也只能算过得去。它的优势是速度——图片“基本即时”生成——这鼓励用户快速迭代,不到一周就让它成为移动端首选生成器。
调用手机相册后,制作表情包和老照片动画变成“一键操作”,不到1分钟即可完成。相比其他产品显著限制名人内容,Grok 允许生成真人,进一步扩大了表情包创作空间,也体现其相对不设限的立场。
2. GPT-5 能力提升,却失去了 GPT-4o 的消费级亲和力
讨论重点包括 GPT-5 在前端代码生成和调试上的优势,这与发布时将编程定位为经济价值来源的叙事一致。但多数消费者主要想要聊天;在这件事上,GPT-5 显得没那么有表现力:感叹号、emoji、全大写反应少了,也少了“它不只是好。它很棒”这类修辞。
两者必须区分:减少让模型变得无法信任的“过度迎合”是好事,但轻松、及时响应的个性是另一项功能。主持人认为,GPT-5 在后一个维度上“退了一步”。
GPT-4o 被直接移除,而不是作为选项与 GPT-5 并列,也让主持人感到意外,尤其是在 OpenAI 已围绕 GPT-4o 的图片生成搭建了一系列界面功能之后。用户“彻底炸锅”后,据报道 Sam Altman 在 Reddit 回复称,GPT-4o 将回归付费用户。
更大的结论是:客观基准上的“最聪明模型”,未必是人们最想聊天的模型;这为陪伴型和娱乐型产品留下空间,它们优化的是趣味性,而非最高 IQ。
3. 医疗 AI 获得产品背书,监管同步收紧
Illinois 刚刚广泛限制没有持证专业人士监督的 AI 治疗;持续支持或针对情绪问题提供个性化建议,也可能被纳入范围。一些心理健康公司暂停在 Illinois 开展新业务或关闭新用户注册,主持人则质疑:私人聊天中的规定能否执行,以及这些限制最终是否会伤害消费者。
与此相反,OpenAI 的 GPT-5 直播展示了一名癌症患者上传文件、讨论诊断和治疗方案,并强调 GPT-5 在由250多名医生参与创建的 HealthBench 上的表现。Justine 认为,OpenAI 不再只是默许医疗领域的“非适应症”使用,而是在“真正为它背书”。
4. Genie 3 与全版权音乐拓宽创意模型栈
Google 尚未发布的 Genie 3,可以根据文字、图片,甚至 Veo 3 视频生成交互式世界。用户向左转或穿过场景时,画面会即时重新生成,就像走进一幅画,或操控一款个人电子游戏。
主持人指出,这套系统成本高,运行时间可能也很长,但仍梳理出两条游戏路径:开发者可以生成并冻结世界,用于传统多人共享游戏;也可以让每名玩家创建个人小游戏,随着探索不断重新生成。在这些世界中移动并录屏,也比提示词生成固定视频片段更适合制作可控电影。
Genie 3 还可能大幅降低生成海量 RL 训练环境的门槛,为数字和实体智能体提供人工制作模拟之外的补充。市场需要的是能让系统学习移动、导航和与物体互动的世界。
ElevenLabs 则针对另一项瓶颈,将音乐模型训练在“全版权音乐”上。对于生日歌和表情包配乐,这种素材来源没那么重要;但对广告、电影、电视和游戏而言,企业需要在商业使用时避免引发版权方追责。
5. Vibe coding 的下一批赢家,将围绕用户风险完成专业化
Olivia 发布的第一款 vibe coding 应用使用 Lovable、fal.ai 和 FLUX.1 Kontext,把用户与 Jensen at NVIDIA 合成到自拍中。应用在几个晚上的时间里完成,随后一夜吸引约3,000名用户,并耗尽她自行设定的100美元 API 预算。
预算用完后,应用不再调用模型,而是生成一张“看起来像2005年 Microsoft Paint 做的”拼接图。更严重的是,有人提醒她 API key 已暴露,用户上传照片的存储桶也不是私有的;她表示已经修复问题。
Justine 和 Anish Acharya 的判断是,现有平台不可能永远“什么都服务所有人”。面向消费者的“带辅助轮版本”应阻止不安全部署,牺牲灵活性,支持移动端,并在5分钟内产出可用结果。
专业用户和企业用户需要相反的产品:能够控制语言、数据库和技术栈,并接入设计系统、CRM 和邮件平台。它们在企业内的获客可能来自自上而下的销售,也可能来自产品驱动增长;消费产品则通过 TikTok 和 Reels 扩散。早期赢家已经是 AI 应用中增长最快的一批,但这个市场仍“太早”。