142: 斑马CPO修佳明:一款能主动教学的 AI 产品是如何出现的
142: 斑马CPO修佳明:一款能主动教学的 AI 产品是如何出现的
摘要
- 斑马口语不是给旧课程外挂聊天机器人,而是一款从前后端、UI、模型到课件都由 AI 驱动的主动教学产品。 产品采用 AI 外教、孩子视频流和互动课件组成的三分屏,每节课 25 分钟;每单元 4 节、每级别 96 节,共分 6 个级别。修佳明称它是集团首款“全栈式的 AI 产品”,AI Agent 只是其中一环。
- 这款产品真正昂贵的部分不是调用模型,而是把模型的自由度压进可交付的教学边界。 项目自 2023 年 8 月立项,两年多研发投入约 2 亿元、团队约 200 人;按当前产能,一个新级别约需一年。团队“一边要保存它的灵活性,一边要限制在设定好的边界内”,修佳明把这个过程称为“跟 AI 模型搏斗”。
- 儿童口语对应的是一个供给长期稀缺、需求却被既有产品形态低估的市场。 修佳明观察到,孩子在大概 KET 水平之前,或一线城市在大概 PET 水平之前,还可以通过各种方式学习;之后便陷入瓶颈,直到大学毕业出国时仍要突击口语。他的判断是“凡是学英语的孩子都有这个需求”。汽车早期也曾被视为少数人的身份消费,“没有这个产品,大家就没有这个需求”。
- 斑马与普通 AI 陪聊的差异,是它拥有跨越一年的主动教学计划和孩子级长期记忆。 每个孩子都有独立向量数据库,持续记录表达、行为、水平、习惯、兴趣乃至宠物名字;自研模型负责课堂教学,DeepSeek 有时用于课后信息整理。每节课要求 100 次以上有效开口,目标不是维持现有水平,而是让能力按规划逐级上升。
- 现阶段最强证据仍是过程数据与长期内测,而不是已经公开的终局学习效果。 产品累计测试 7000 多节课,最早一批测试用户已跟随学习半年多,学习时长最长的用户完成了 26 周;团队正上线由准确度、流利度、丰富度构成的“口语力”指标,认为上满 4 节即可较准确估计水平。修佳明的表述是“每一节课都是一个考试”,L4 还将用 KET 口语模考提供外部验证。
- 商业化上,团队按学习产品而非廉价 AI 工具定价:每级别一年 3600 元。 内测曾以约 1500—2000 元售卖,家长更在意“多少天交付什么效果”,并不特别关心是真人还是 AI;团队判断十万用户以内的规模压力不大。不过首发只有一个级别、第二个级别随后推出,约一年增加一级,内容产能会直接约束扩张速度。
- 模型升级更可能成为斑马的供给侧红利,但护城河能否成立取决于教学经验能否持续转化为效果。 修佳明欢迎更强模型和实时 AIGC 课件,甚至表示技术成熟后可以取消现有固定课件;但他强调儿童教学“数据没有经验更有说服力”,模型无法仅凭通用语料决定面对具体孩子时该先教什么、如何降级。团队选择的产品标准是:“如果这个事情老师也能做、人也能做,我们就不做。”
精读
1. 斑马把一对一外教课堂从底层重新做成了 AI 产品
- 产品以三分屏呈现:二维 AI 外教、孩子自己的直播画面,以及承担主要教学任务的互动动画课件;单节 25 分钟。
- 课程体系分 6 个级别,每级别 96 节,每单元 4 节。表面像真人一对一,内核却从前后端到 UI 都由 AI 接入和驱动。
- 修佳明把它定义为一个解决窄问题的“尖刀型”产品:先下钻儿童口语,而不是从通用教育助手铺开。
2. 2014 年开始的儿童语音积累,成为大模型产品的前置资产
- 元力科技从 2014 年组建 AI Lab,早期重点是自适应算法、视觉识别、ASR、TTS 和测评,并非大语言模型。
- 斑马既有产品积累了大量儿童语音,由此训练出更适配儿童年龄段的识别和英语测评模型;修佳明称其属于“上一代”技术,却仍是课堂可用性的底座。
- 斑马口语于 2023 年 8 月立项。此前在旧产品中加入大模型对话,只是“上个时代的产品思路,加了一些 AI 的功能”。
3. 团队没有消灭“幻觉”,而是把创造力关进教学边界
- 修佳明判断,项目立项时的模型能力基本已经够用,后续模型进步主要改善呈现效果和效率;难点从一开始就是确定性。
- 团队两年多都在“跟 AI 模型搏斗”。他的反常识判断是:“幻觉其实并不一定是一个负向的词”,有时它正代表模型的创造力。
- 一名孩子谈到礼物时,AI 学伴主动说“I’m jealous”,情绪化回应让孩子很开心;模型同时会依据孩子级别筛选用词,保证大致可理解。
4. 25 分钟被拆成十几个小目标,让 Agent 始终承担主导责任
- 每节课拆成十几个两三分钟的环节,每段都有明确目标和达标数据;AI 预先知道要完成什么,表达因此始终指向教学结果。
- 这不是任孩子自由聊天的陪伴机器人,而是配合课件推进任务、必要时拉回进度的主动型 Agent。每一节 25 分钟课程都被当作独立产品逐一验证。
5. 安全性来自训练、测试、监控和人工回流的多层约束
- 训练阶段包括数据清洗、分类、强化训练、对抗性“找茬”和正向样例奖励,让模型理解哪些表达不可使用。
- 上线前的大规模测试集会随真实数据持续更新;上线后由元力大模型支持实时监控错误内容和敏感词,人工还会继续质检、标注。
- 真实问题会反向进入模型与策略。团队不是一次性证明“模型安全”,而是以每节课为单位持续缩小错误空间。
6. 口语的稀缺性不在知识,而在持续获得合适的实时对话
- 听力、阅读、单词和语法可以自学或由一名老师批量教授;口语却必须有实时对象,对方还要理解学习者水平并提供大量开口机会。
- 非专业母语者能聊天,却无法设计教学路径和逐个攻破知识点;专业且口语足够好的中国老师供给同样有限。结果是很多孩子在 KET、PET 附近停住。
- 程曼祺追问写作是否也是类似输出难题,修佳明的区分是:写作可以停下来查词、模仿范文,三个月突击也能见效;口语现场“一停下来,这个对话就进行不下去了”。
7. “所有学英语的孩子”是需求判断,而不是已经验证的市场数字
- 修佳明不愿把市场规模“说死”,但判断“凡是学英语的孩子都有这个需求”,因为听说读写中的“说”并不需要另行论证。
- 他的汽车类比是:早期汽车慢且更像少数有身份、有钱人的消费,需求看似只属于少数人;产品普及后才显出广泛需要。“没有这个产品,大家就没有这个需求。”
8. 陪聊只能维持水平,主动教学必须决定下一步学什么
- 被动 AI 陪聊的上限,往往是维持学习者现有水平;能力提升还涉及增量幅度、练习量和材料选择,不能交给通用模型随机发挥。
- 剑桥体系每级词汇与孩子能接触的材料、生活范围和认知范围相关。普通模型既不了解这条路径,也缺乏跨越一年的长期教学计划。
9. 长期记忆被放在孩子自己的向量数据库,而不是模型参数里
- 每个孩子都有独立数据库,保存每节课说过的话、做过的行为,以及长期形成的水平、习惯、状态、兴趣、家庭信息和宠物名字。
- 新表达会触发相关历史记录,再与当前信息共同生成反馈。课堂对话主要由自研模型完成;DeepSeek 有时负责课后报告、信息整理和维度归纳。
10. 教学能力被编织进逐级降难度的脚手架
- 孩子答不出特殊疑问句时,AI 会依水平改成选择或一般疑问、提供提示、带读,再回到原目标;关键是“降一级还是降两级”。
- 类比也要调用旧知识:孩子已掌握 come 变 came,AI 可用它引导推理 become 变 became,而不是直接报答案。
- 难度边界不能写死。孩子主动谈到 Golden State、奥特曼、Elsa 或蛋仔派对时,AI 要接住通识,再把对话引回课程;规则因孩子是否主动、是否听懂而动态调整。
11. 温暖人格服务于表达,而不是单纯提供情绪价值
- 自研模型融入教学法、心理学和语言学,并被要求始终积极反馈,不能只说笼统的“你很棒”,而要指出孩子刚才哪句话、哪个部分说得好。
- 修佳明强调,“好”不是最终目的;目标是降低外语表达的情感过滤阈值,让孩子处在舒适、没有压力的环境里,愿意继续输出。
12. 儿童语音基础设施决定课堂是否真的可用
- 团队模拟背景音、距离和说话方向等家庭场景,处理孩子不面对麦克风、环境嘈杂等问题。
- 系统可以排除成人声音;二孩家庭里还会记住上课孩子的脸和声音,尽量避免弟弟妹妹的声音干扰识别。
13. 每节课 100 多次有效开口,解释了为什么进步慢且强度高
- 25 分钟内孩子要完整表达 100 多次,约每分钟 4 次。修佳明说,这使课堂处于“非常紧张的学英语”状态,孩子要跟着课件持续完成任务。
- 进步通常不是线性的:第一个月因熟悉课堂和敢于开口而较快,约三个月后可能遇到瓶颈期,再用两周至一个月突破。
- 因此一个级别被设计为一年。口语提升“见微知著”,不像写作模板那样适合短期凿实。
14. 动画和彩蛋暂时由策略组合,实时 AIGC 仍受延迟限制
- “画妈妈”环节会根据孩子描述组合画面;孩子看到结果很震惊,嘴上却回答“no”。这还不是模型实时生成,而是灵活度较高的可组合课件。
- 彩蛋必须在合适语境触发:孩子表示不想办生日 party 后情绪低落,AI 回应“不办 party 也要送礼物”,再调出礼物动画。不是每个孩子都会遇到。
- 修佳明期待未来按孩子兴趣实时生成课件,但“聊奥特曼后等五分钟画出来”无法成立;儿童课堂又不能只靠两张脸对聊,素材生成速度是硬约束。
15. AI 外教形成了独立位格,但团队从未把它设计成“像人”
- 程曼祺担心孩子会混淆有人格的 AI 与真人边界;修佳明回答,产品采用二维形象,本来就没有追求“百分之多少像人”。
- 他的类比是“狗就是狗”:宠物可以有人性、建立情感关系,却不会因此被误认为人。AI 外教同样只是认知体系里的一个新位置。
- 孩子会通过稳定反应形成对它的图式,知道自己说什么大概会得到什么回应;修佳明认为孩子一开始就知道它不是真人,也不会把它误认为人,而是较容易接受这种带有一定人性的新的存在形式。
16. 对抗式孩子被要求两轮内回课,但长期使用后新鲜感会消退
- 孩子偏题时,AI 要在两轮内回到课件;距离太远或涉及敏感内容便不回答,必要时严肃提醒“我们在上课”,再用简单任务拉回注意力。
- 测试过程中这类情况很少。孩子上到第四、第五节后,和模型 battle 已不新鲜;很多人早已使用过 DeepSeek、豆包,课堂注意力反而集中在英语任务上。
17. 7000 多节内测暴露的不是宏大错误,而是情境反应的细小缺口
- 内测累计超过 7000 节,最早一批测试用户已跟随学习半年多,学习时长最长的用户完成了 26 周;产品定义没有重大推翻,但每堂课都会被回看并产生局部迭代。
- 教师节当天,一名孩子给 Jessica 看贺卡和花。AI 微笑道谢,语义正确却“不够激动”,团队随后补上教师节、圣诞节、春节等自然日历策略和彩蛋。
- 早期还有孩子一句话读五遍,几乎崩溃,AI 却保持“冷漠的耐心”。团队由此加入轮次上限、拆分、降级、提示及更换材料等策略。
18. 效果衡量正在从开口次数走向“口语力”
- 内部“口语力”由准确度、流利度、丰富度三个大维度组成,每项再拆两个小维度,以客观数据和公式聚合。
- 单节 100 多句话已能粗估水平,上满 4 节后会更准确。修佳明称口语“不太需要额外考试”,因为孩子没有拐杖,“每一节课都是一个考试”。
- 若团队对自有体系不够有信心,L4 计划交付 KET 水平并赠送 KET 口语模考,用外部考试验收成果。
19. 价格、产能与教学经验共同定义了这门生意的扩张边界
- 课程不开放重复学习:每单元含两节对话、一节表达和一节综合运用,另有预复习,知识还会循环复现。团队认为每周两次已接近多数家庭上限,重上只会浪费 25 分钟。
- 付费按级别计算,一年 3600 元;内测售价约 1500—2000 元时接受度较好。家长最关心交付效果,试听后也会直接听取孩子反馈。
- 约 200 人分布在教研、动画交互、产品、研发、音视频中台、AI Lab、标注和质检等团队,累计研发投入约 2 亿元。修佳明称可靠性从 99.9% 降到 97% 就不可接受,因为“一百个人有三个人在教育上出错了”。
- 首发只有一个级别,第二个很快跟进,之后约一年上线一个级别,从中间年龄段向两端拓展。面对通用模型竞争,修佳明的护城河判断是:“数据没有经验更有说服力”;面向具体孩子先教什么、怎么降级,资料全部公开也不等于能复制。