先锋 趋势 方法 投研 作者
压过 Noam Shazeer,以众包方式打造 DAU 达 140万的 Chai AI——对话 William Beauchamp,Chai Research
返回节目精读

压过 Noam Shazeer,以众包方式打造 DAU 达 140万的 Chai AI——对话 William Beauchamp,Chai Research

摘要

  • Chai 的判断是,社交 AI 最终会成为一个分布式创作者平台,而不是只靠更多数据、算力和研究人员占优的单一大模型。 William Beauchamp 预计,专业团队和用户会分别塑造不同的 AI,就像量化机构在同一个金融市场里各自专精一样。「必须存在这样一个平台,让一个小团队也能为独特目的打造 AI。」

  • Chai 找到产品市场契合点,是在效用型机器人全部失败、Beauchamp 的妹妹做出一个治疗师机器人并吸引到 20名用户、每人约使用 20分钟之后。 新闻、食谱、笑话、测验、名人和网红都没有起色;即时且不带评判的对话才是「AI 强 10倍的事情」。随后,Chai 让消费者只需输入提示词、图片和名字就能创建角色,由此发现了工程师绝不会主动设计的冲突、恋爱和人物原型需求。

  • Alessio 称 Chai 的 DAU 已达 140万、收入超过 2200万美元;Beauchamp 没有明确确认这些数字,只说他认为用户数去年增长了 3倍,收入增幅超过 1倍。 单次典型使用约 90分钟,而 TikTok 被引用的时长是 70分钟,并产生约 150条消息,因此推理经济学的重要性远高于问答类产品。真正的前沿不只是基准测试表现,而是「每美元对应的性能」。

  • 2024年的增长曲线反映了 4个重大变化:修复基础设施、竞争对手疑似减弱买量、更好的模型,以及付费分发。 DAU 接近 50万时,Firebase 已无法稳定扩容,Chai 被迫经历痛苦的 3个月迁移,之后才触及 150万 DAU;后来,Beauchamp 怀疑 Character.AI 在创始人离开后减少了广告投放。Chai 随后把买量提升到约 4万美元/天,将用户年化增速从约 2倍推升至 3倍:先把产品做出来,再通过买广告接上一枚巨大的「火箭」。

  • Chai 最强的运营优势,是一套把传统 30天留存测试压缩到约 3小时的人类反馈闭环。 每个提交的模型都会交给用户进行比较;Beauchamp 称,约 5000次生成就能得到准确反馈。如今约 5名研究人员每天评估 20–50个模型,每周至少上线 100个。他认为,大约在 10月的某个时间点,用户评论从 Character.AI 更好转向 Chai 更好——这是他看重的证据,因为「你骗不了消费者」。

  • Chai 在投入 3个月后发现语音没有带来可测量的留存、参与度或变现提升,于是放弃了把语音作为增长主线。 只有 10–15%的用户尝试过语音,使用时间占自身使用时长的 10–15%,折算下来只占整体体验约 2%,尽管 Beauchamp 坚称模型本身非常好。他如今的产品标准很苛刻:一项功能必须对大多数用户的大部分体验都重要,并且让人觉得「这是一件大事」。

  • Beauchamp 已经推迟了自己对 AGI 的时间表,也不接受当前 LLM 天生就是强推理引擎的说法。 他称 LLM 是带有「超级知识」的模拟器:极其擅长存储、检索和生成,但按他对智能的定义,仍然不够聪明。Chai 不做流式输出,而是生成 16个完整候选答案,再用奖励模型选出一个。他以 5000万条消息训练这类模型作为示例,并未确认这是已部署的配置。

精读

1. 量化交易利润为寻找影响力提供资金

  • Beauchamp 于 2012年从 Cambridge 毕业,当时靠打扑克积累了约 10万美元。小资金反而是优势:一个每年能赚 10万美元的异常机会,对 1000万美元本金只意味着 1%的收益,对 10万美元却意味着 100%的收益,因此他自学 Python 和机器学习来捕捉这种机会。

  • 这家公司最终每年赚取约 500万美元,团队约有 15名毕业于 Oxford 和 Cambridge 的数学家、物理学家,只交易团队自己的资金。没有「客户抱怨」,也没有投资者约束风险,这正是 Beauchamp 曾经向往的量化交易理想状态。

  • 30岁时,他决定再增加一艘游艇规模的财富,也不会产生真正有意义的影响。加密货币作为赌博工具、以及规避货币监管和银行限制的手段,看起来很特别;但其更广泛的区块链和 Web3 逻辑「确实没太大意义」,于是他把精力转向语言模型。

2. 机器学习的 S 曲线削弱了单一超级 AI 的叙事

  • 阅读 Google 发表的研究,以及当时仍然开放的 OpenAI 的论文后,Beauchamp 认定 LLM 会很重要。但他拒绝了打造单一智能的主流竞赛——靠最多的数据、算力和研究人员堆出一个模型:以他的经验,机器学习性能遵循 S 曲线,通常会在人类能力附近进入平台期。

  • 自动驾驶、图像识别和语音识别都支持这一判断;AlphaGo 是显眼的超人类例外。因此,Beauchamp 预计 AI 会更像金融市场:高频、中频、股票等不同专业机构,通过各自的算法在一个共享市场中竞争,而不是都存在于一家全能量化机构内部。

  • Chai 的创始命题由此直接推导出来:「必须存在这样一个平台,让一个小团队也能为独特目的打造 AI。」它对应的不是《大英百科全书》,而是 Wikipedia、YouTube 或 Twitter——一个由分布式参与者发现中央机构无法发现之物的生态。

3. 效用型机器人失败,暴露了对话才是原生产品

  • Chai 最初允许开发者提交带有文本输入、文本输出接口的 Python 智能体。Beauchamp 做过 Reddit 新闻机器人、食谱助手、冷笑话、测验和知识问答;尽管他预想过后来答案引擎式的产品,却发现「显然没有产品市场契合」,因为当时模型很弱,对话式效用并没有增加多少价值。

  • 他妹妹开发的治疗师机器人一夜之间改变了方向:约 20名活跃用户平均与它交流 20分钟。对话可以在凌晨 3点即时发生,不带评判,也比等朋友回复更容易;即使只是 AI 生成的一句赞美,也带来了效用型产品此前没有的体验价值。

  • Beauchamp 将这种参与式体验与 TikTok 或 Instagram 的被动消费区分开来。刷 40分钟短视频可能让人懊悔,因为「我什么也没完成」;与 AI 互动则让人感觉自己有所贡献。他引用用户的说法称,Chai 帮助他们应对饮食失调、抑郁和人生低谷,但强调这些只是用户的反馈。

4. 消费者作者,而非软件开发者,打开了角色目录

  • 用 kbot、名人和网红人为制造需求的尝试同样失败。真正的突破在于认识到,Python 开发者并不想构建社交角色,但消费者想做;于是 Chai 通过提示词、图片和名字,让用户使用一个 60亿参数的 GPT-J 模型。

  • 用户创造出了 Beauchamp 从未预测过的类别:操场上的霸凌者、争论、打斗,以及陌生的恋爱人物原型。Chai 不再需要猜测 1%的人想要什么,而是让用户自己创造,为更广泛的人群提供所需的多样性。

  • 主持人批评 Chai 的创作者层看起来仍然异常单薄,Beauchamp 完全接受了这一点。他的答案是让短描述更具可操控性:只需「一艘宇宙飞船」、3名船员、戏剧冲突和打斗,就能胜过专家型 SillyTavern 创作者使用的 1000字角色卡。

5. 风险资本竞争让 Chai 认识到模型质量的价格

  • Beauchamp 回忆,到 2022年末或 2023年初,Chai 的 DAU 已接近 10万,并成为 App Store 上排名第一的 AI 应用。Character.AI 出现后,提供了非常相似的体验,团队起初还嘲笑这个产品;随后 Character.AI 融资 1亿美元,之后又融资 1亿美元。

  • 当时 Beauchamp 可能投入了约 200万美元,使用的是 GPT-J 6B。Chai 的示例经济学是,一名用户完整使用一次约花费 1美元;如果有 100万用户,AI 总成本就是约 100万美元。Character.AI 可以花费其 100倍,用户也注意到了差异:「为什么你们的 AI 这么蠢?」Chai 于是搬到 Silicon Valley、获得融资,并认识到消费级 AI 是一门 Silicon Valley 式的超大规模生意。

  • Alessio 称 Chai 的 DAU 已达 140万、收入超过 2200万美元。Beauchamp 回应说,他认为用户数去年增长了 3倍,收入增幅超过 1倍。他说自己认为 Character.AI 的估值接近 30亿美元,DAU 为 500万。

  • 他对 DeepSeek 的比较,核心围绕推理经济学和创始人驱动、以客户为中心的执行力展开。他称赞 DeepSeek 最新的 V2,重点是其推理引擎和显著更小的 KV cache,后者降低了推理成本;他认为每美元对应的性能比基准测试分数更重要。他也关注 Llama 4 能否实现同样的提升。

6. 基础设施与分发解释了增长曲线上的明显拐点

  • Chai 从 1个 DAU 起一直使用 GCP,直到 DAU 接近 50万,期间尤其重度依赖 Firebase——据称超出了 Google 工程师建议水平约 3倍。这层抽象让团队可以专注于 AI,直到服务中断迫使其至少经历 3个月的迁移和服务拆分。

  • 服务中断造成的损害不止于当天流量。新用户遇到无法正常运行的应用,留存、消费、评分乃至 App Store 排名都会受到影响;修复后端很快,但恢复自然排名可能要久得多。重建后的技术栈随后支撑 Chai 增长至 150万 DAU。

  • Beauchamp 怀疑,Character.AI 的创始人离开后,公司降低了用户获取投入。他用一个每天花费 10万美元的假想公司与一家完全不花钱的公司来说明竞争影响,但没有把这个数字说成是 Character.AI 已披露的实际支出。

  • 一名前 ByteDance 增长负责人得知 Chai 在没有广告的情况下做到约 100万 DAU 后感到震惊。Chai 先测试了约 1万美元/天,随后是 2万美元,如今约为 4万美元;Beauchamp 说,这把原本约 2倍的年度增长轨迹转成了 3倍。

7. 3小时反馈闭环成为模型开发引擎

  • Beauchamp 的运营信条是「成功源于失败」:平淡期代表学习,增长期则是在收获学习成果。Chai 在 Q2 的关键开发,是一套把任何提交的模型交给约 5000名用户评估的系统,并根据用户觉得哪些输出更有趣、更能带来参与感进行排名。

  • 这让约 5名研究人员从每周可能评估 3个模型、甚至一度每月难以测试 5个模型,提升到每天 20–50个、每周至少 100个。原本需要等待 30天观察第 30天留存的标准队列测试,被压缩成约 3小时的反馈信号。

  • 由此形成的速度,让 Chai 可以快速迭代 DPO 微调、提示词、模型混合、拒绝采样和奖励模型。他认为,大约在 10月的某个时间点,Reddit 反馈和用户交流发生了转折:从「Character.AI 更好」变成「你们更好」;在切换成本低、单次使用长达 90分钟的情况下,Beauchamp 认为用户不可能被质量差异蒙骗。

8. 音频失败,迫使产品标准进一步收紧

  • Chai 用 3个月解决语音延迟、成本、质量、激活和交互设计问题;按 Beauchamp 的说法,其上线时间至少比 Character.AI 早 9个月。但 A/B 测试显示,留存、参与度和变现都没有变化,团队还花了 1周排查一个并不存在的 bug。

  • 一名主持人猜测,可能只是模型质量不够好;Beauchamp 强调回应:「不,它们非常好。」只有 10–15%的用户激活音频功能,并且只在 10–15%的时间里使用,最终只改变了约 2%的整体体验。

  • 他的结论是,便利性不会自动创造目的地。成功的功能必须让大多数用户在其大部分使用过程中,都获得足够独特、足够有吸引力的体验,并产生「哇,这是一件大事」的反应;否则,即使技术优秀,也无法推动公司层面的指标。

  • 因此 Beauchamp 认为,音频和图像生成并不是用户最首要的问题。他说:「所有 AI 都是 Silicon Valley 的中年男性在生成」,真正未被满足的需求,是让用户自己训练并塑造体验。

9. Chai 想构筑的护城河,是不断变厚的 UGC 层

  • 在 Beauchamp 看来,如今的提示词、图片和角色名只是「我们能做的 1%」。他的完成标准刻意设得极高:除非有一个创作者团队能在平台上制作 AI 内容、每年赚取或花费 1亿美元——或者不管最终数字是多少——否则 Chai 就还没有完成;这类似于大型视频创作者的经济规模。

  • 这座护城河由创作者、消费者和算法共同构成。用户行为训练推荐系统;推荐结果告诉创作者什么有效;更好的内容吸引更多用户。Beauchamp 用 MrBeast 在 Amazon 上适配性更弱作为例子:YouTube 的迭代会针对特定生态优化他的缩略图、开场和内容。

  • Chai 想要的是类似 TikTok 的创作杠杆,让普通人借助内置音乐和特效就能制作有趣内容。「用户不想被迫工作」;平台应该让短提示词也能有效,而高级创作者则贡献经过微调、能够产生真正独特行为的模型。

10. ChaiVerse 把实时人类品味变成开放式模型竞赛

  • 每天有数百个模型进入 Hugging Face,背后是创作者投入的数据、算力和劳动。ChaiVerse 提供托管这些模型、为其分发流量并收集用户两两比较判断的服务。Beauchamp 称,得到准确反馈大约需要 5000次生成,采用的是类似 LMSYS 的方法。

  • 他的分布判断是,底部 80%的模型「相当糟糕」,可以直接忽略。顶部 20%会显现出有用差异,可能体现在描述、个性、幽默或逻辑上;但在这些模型之间按请求进行路由,成本很高,带来的优势也很小。

  • Chai 更倾向于模型混合:随机 50%的请求交给聪明模型,另外 50%交给有趣模型。「随机是一种非常强大的优化技术」,Beauchamp 说,因为它能进行广泛探索,同时具备异常稳健的表现。

  • 他用最初提交的模型可能只有 1000–1100 Elo 分、随后反复失败、最终突然提升来说明迭代过程。Chai 已向创作者支付超过 10万美元,但付款没有提高提交频率,主要只是为算力提供资金;例如一名 17岁创作者就把 1000美元奖金花在了一块实体 GPU 上。

11. 人类偏好是北极星,但也会产生偏差

  • 面对 Elo 不可能成为 Chai 唯一评估指标的质疑,Beauchamp 称它是北极星,因为「人类知道自己想要什么」。设计型评测只是快照,会趋于饱和并需要更换;两两偏好则保持通用性,并且能随着 Chai「反馈丰富」这一独特位置持续扩展。

  • 他承认,原始偏好会奖励表面技巧:按照他的例子,任何 LLM 只要训练自己使用脏话,就能变得更有趣 20%。Chai 对安全等阻塞项使用过定向评测,但称这些测试可能在 1个月内饱和;长期答案是让人类反馈更稳健,而不是用静态基准取代它。

  • 一名主持人提出分层质疑:治疗、角色扮演和不适合工作场景的用户显然不同。Beauchamp 给出了反直觉的回答:偏好仍然高度相关。一个人可能给答案打 10/10,另一个人打 7/10;但要实现强个性化,必须让一组人热爱的内容,成为另一组人觉得无聊的内容。AI 内容目前还没有多样到足以形成 YouTube 规模的推荐流分化。

12. 超级知识与推理时搜索,取代近期 AGI 叙事

  • Beauchamp 说,他的 AGI 时间表「确实已经推迟」。LLM 看起来不像推理引擎,更像是在预测最可能的后续内容的模拟器,就像一个物理游戏模拟汽车坠落到搭建好的桥上时会发生什么。

  • 他的区分是知识与智能:模型可以存储和检索比任何人类都更多的信息,但这种优势很容易被误认为推理能力。他接受「超级知识」是更好的术语,并认为 AI 处于 20年旅程的第 4年,大致相当于 1998年的互联网。

  • William 将 OpenAI 的 o1 和 o3 与类似树搜索的方法联系起来;swyx 指出,OpenAI 并未表示自己使用树搜索。William 称这是隐含信息,并表示这类系统更擅长推理,但拒绝称其为推理引擎。他坚持认为,模型的原生优势在于检索、存储和生成:「它就是能编东西。」

  • Alessio 称 Chai 去年在算力上花费了 1000万美元,可能会把这一数字提升到 3倍;William 随后强调推理优化。他说,Chai 评估过 MK1 的推理引擎,速度远快于 vLLM,并突出创始人 Paul Merolla 的硬件专长和 CUDA kernel 工作。

  • Chai 从未做流式输出,因为流式输出会阻止拒绝采样。与其把首个 token 的生成时间优化到约 4秒,Chai 可以用约 10秒生成完整答案,并提供更大的模型。它会生成 16个完整候选答案,再用奖励模型选出一个。此类模型的一个例子,是用 5000万条消息训练,并根据用户是否回复进行标注,从而预测哪个答案最可能促成回复。