No Priors 第143期|与 ElevenLabs 联合创始人 Mati Staniszewski 对谈
摘要
ElevenLabs 以一款拥有500万 MAU的创作者产品叠加一项营收接近一半的企业级 agents 业务,在350名员工的规模下实现了3亿美元 ARR。 自助订阅和创作者业务仍约占收入的50%;数千家企业客户覆盖“从财富500强到增长最快的一批 AI 初创公司”。经营层面的信号是业务足够宽,但没有放弃最初的研究优势。
创始切口来自波兰糟糕的配音体验:所有角色都由同一个平板旁白配音,但公司的判断已扩展为,声音才是计算最自然的交互界面。 ElevenLabs 的目标,是让“原声、原本的情绪、原本的语调”跨越语言传递,这一点已在 Lex 对 Narendra Modi 的采访中得到展示。Mati 更大的判断是,键盘和屏幕交互“感觉已经坏掉了”,因此机会远大于传统配音市场的支出规模。
Mati 的运营模式是研究先行、产品并行,再围绕具体问题组建小型跨职能实验室。 一个约5人的声音实验室先解决了接近真人的叙述问题,随后 ElevenLabs 扩展到有声书和配音;之后的 agent 实验室则把语音转文字、LLMs、文字转语音、集成、测试和监控组合起来。产品团队能看到研究路线图,只有在相关突破看起来还要超过3个月时,才通常会自行开发替代方案。
客户支持是最先大规模落地的 agent 类别,但声音交互正从被动处理工单,走向发现、结账、教育、媒体和政府服务。 Meesho 的 agent 已从退款和物流追踪推进到产品引导,并可能进一步覆盖结账;MasterClass 让学习者与 Chris Voss 练习谈判;乌克兰正在推进 Mati 所称的“第一个 agentic government”。这使商业价值从节省人力成本,扩展到创造收入和全新的体验。
声音质量不是一个单一标量基准,因为即使底层模型质量不同,用户偏好也会随声音身份、语言、受众和表达方式改变。 一名客户要求声音“尽可能机器人化”;而一项覆盖日本和韩国的部署,则希望面向年轻来电者使用兴奋的声音,面向老年用户使用平静、缓慢的声音。因此,ElevenLabs 会提供声音指导,并预计最终针对每个人、每种场景动态选择声音。
ElevenLabs 假设基础模型终将商品化,并将研究领先视为只有6到12个月的优势。 Mati 说,“研究只是起跑优势”;长期价值必须通过分发、声音、集成、工作流,以及连接模型与业务逻辑的产品层不断累积。开源模型的叙述质量已经很强,但可控性和实时编排仍有差异化;一个可能只有50-100名顶尖音频研究员的集中人才池,仍能带来架构级跃迁。Mati 估计其中约10人可能在 ElevenLabs。
近期路线图瞄准可控的多模态创作,以及更低延迟、更具情绪感知能力的 agents,同时保留级联系统服务可靠的企业工作负载。 据称,Scribe v2 在 FLEURS 的前30种语言上实现了低于150毫秒的延迟和93.5%的准确率;融合式 speech-to-speech 可能更富表现力,但也可能引入幻觉,且可见性更低。Sarah 估计,接近真人的对话交互至少还需要1年,但可能在1年内到来;实时配音或翻译则可能在2年内实现。个性化教育——“随时拥有一名专属老师”——是最大的尚未兑现的应用。
精读
1. 糟糕的波兰配音,揭示了一个全球性界面市场
Sarah Guo 先从规模切入:ElevenLabs 拥有350名员工、3亿美元 ARR、超过500万月活创作者用户,以及数千家企业客户。收入约为“五五开”,一半来自自助式创作者订阅,另一半来自日益以 agents 为核心的企业业务。
她当初对投资的质疑值得保留:ElevenLabs、Midjourney、Suno 和 Hunyuan 这类创作工具,看起来可能只服务于一小部分人;传统配音市场本身也并不算大。Mati 的信念来自波兰:外国电影经常让所有男性和女性角色都使用同一个平板旁白,“体验非常糟糕”。
他们提出的替代方案不是简单翻译台词,而是保留表演者本身:“让原声、原本的情绪、原本的语调跨越语言传递。” ElevenLabs 已在 Lex 对 Narendra Modi 的采访中展示这一理念,但 Mati 进一步把它延伸到整个计算领域:人类仍把时间花在键盘和屏幕前,尽管语音才是“最自然的界面”。
2. 以问题为中心的实验室,把基础研究接入产品
ElevenLabs 最初尝试优化现有模型,用于叙述和配音,但输出过于机器人化,无法让人真正享受。Mati 将关键突破归功于联合创始人——两人相识已有15年——以及早期研究团队,他们做出了产品所需要的基础改进。
最初的“声音实验室”约有5人,由研究员、工程师和运营人员围绕一个共同使命协作。研究先行,随后叠加一个简单可用的产品层,再逐步扩展出有声书、电影旁白和配音的完整工作流。
接近真人的输出实现后,“agent 实验室”开始解决按需获取知识的问题,负责编排语音转文字、LLMs 和文字转语音。产品要求很快从延迟和准确率,扩展到旧系统集成、函数调用、生产部署、测试、监控和评估。
一些实验室是由明确需求推动的:客户希望在生成语音旁边加入音乐,于是公司开发了完全授权的音乐模型,最终又结合合作伙伴的图像和视频模型,形成更广泛的创作套件。配音则更多来自判断和信念;Mati 预计,跨越语言障碍进行实时沟通的“完整 Babel fish 理念”将成为一个巨大的市场。
3. 声音质量无法被压缩成一张排行榜
Sarah 指出了买方难题:多数企业决策者不是机器学习科学家,即使研究人员,也没有覆盖所有音频场景的基准。客户可能认得出一个令人信服的声音克隆,但未必知道如何选择或评估最佳声音。
ElevenLabs 的应对方式,是配备专门的声音专家,把品牌和受众要求转化为声音选择,并提供包括 Sir Michael Caine 在内的标志性人才资源。需求差异极大:一家欧洲大型企业要求声音“尽可能机器人化”;一项覆盖日本和韩国的部署,则为年轻来电者匹配兴奋的声音,为年长客户匹配平静、较慢的声音。
Mati 认为,更棘手的问题在于,替换声音可能实质性改变用户对模型的比较,即使技术质量本身存在差异。标准化标注更擅长记录“说了什么”,却难以记录“怎么说”——情绪、口音和表达方式——因此 ElevenLabs 不得不自行构建这套定性音频标注能力。
4. Agents 正从客服走向交易与体验
客户支持的规模化速度最快,但 Mati 看到的变化,是从“我遇到了一个问题”转向覆盖客户全流程的主动协助。在印度电商公司 Meesho,agent 已从退款和包裹追踪扩展到产品发现、礼物推荐、导航,并可能进一步覆盖结账;他还提到 Square,说明语音交互正从下单走向发现。
互动媒体让静态知识产权变得可以对话。ElevenLabs 曾与 Epic Games 合作,将 Darth Vader 放入 Fortnite,让数百万玩家实时与这一角色互动;Mati 预计,这一模式还会扩展到书籍、游戏和其他故事世界。
教育是他最坚定的应用判断。Chess.com 可以让 Hikaru Nakamura、Magnus Carlsen 或 Botez sisters 成为老师;MasterClass 则让学习者直接致电 Chris Voss,练习一场谈判,而不是单纯观看他的课程。模型由此把内容从顺序播放,变成了互动练习。
在乌克兰,ElevenLabs 正与数字化转型部合作,推进 Mati 所称的“第一个 agentic government”。拟议系统将整合围绕福利、就业和办事流程的公民支持、主动公共信息服务,以及个人辅导;中央数字化转型职能则与各部委的工程负责人配合。
5. 平台广度,而非单点方案,是 ElevenLabs 的竞争答案
Sarah 梳理了企业客户的选择:通过 Palantir 或大型咨询公司部署,使用 ElevenLabs 或 OpenAI 这样的平台,或者购买 Sierra 这样的场景专家方案。Mati 坦率承认,对于一个孤立问题,ElevenLabs “很可能”不是最佳选择。
这一平台更适合那些要在客户支持、内部培训、销售和新客户体验中部署对话式界面的组织。客户可以只使用部分组件,与现有内部投入组合,也可以引入 ElevenLabs 的工程师;国际化声音、语言和集成能力则是另一项明确优势。
面对 Google 和 OpenAI,Mati 认为音频既需要专注的研究,也需要满足客户实际需求的产品层——包括那些不那么光鲜但不可或缺的工作。他声称公司在文字转语音、语音转文字和编排方面处于基准领先位置,并补充说,音频对单纯规模的依赖小于对架构突破的依赖:“人数并不重要”,真正重要的是顶尖人才。
他的让步很明确:“从长期看,模型会商品化”,时间可能是2年、3年或4年。开箱即用的叙述质量已经在开源和商业模型之间趋同;可控性仍然更难。长期路径将是研究、产品,然后是由分发、声音、集成和工作流构成的生态系统。
6. 研究争取时间,界面转向导师与机器人
Sarah 提出了一个不太舒服的判断:技术优势可能持续1年,也可能持续10年,但不可能无限期守住。Mati 表示同意:研究能带来“6到12个月的优势”,让客户更早获得某项能力,同时给 ElevenLabs 时间构建周边产品。团队与公司内部共享的研究项目协作,并以3个月作为“自行开发还是等待”的大致分界线。
当前工作覆盖可控的文字转语音、近100种语言的语音转文字、完全授权的音乐模型,以及音频与视觉模型的组合。在 agents 方面,据称 Scribe v2 在 FLEURS 前30种语言上实现了低于150毫秒的延迟和93.5%的准确率;即将推出的编排机制则应能降低端到端延迟,并纳入情绪上下文。
未来1年,面对可靠性要求较高的企业部署,Mati 仍选择语音转文字、LLM、文字转语音的级联系统,因为每一步都可检查,也能调用工具。融合式 speech-to-speech 可能更富表现力,但伴随幻觉风险。Sarah——而不是 Mati——估计,类似他们这场对话的交互仍至少需要1年,但可能在1年内实现;她预计实时配音或翻译将在2年内到来。
Mati 预计陪伴型产品会变得重要,但他个人更偏好“Jarvis”式超级助手,而非社交替代品:它理解他的上下文,能拉开百叶窗、播报天气和播放音乐。他最确信的未来仍是“随时拥有一名专属老师”,同时也明确保留不受技术打扰的人际互动;声音将成为“agents 十年”以及随后“机器人十年”的关键界面。