先锋 趋势 方法 投研 作者
与Khan Academy工程总监Shawn Jansepar谈教育领域的AI革命
返回节目精读

与Khan Academy工程总监Shawn Jansepar谈教育领域的AI革命

摘要

  • Khan Academy的核心判断是,GPT-4已将一对一AI辅导从模糊愿景变成可部署产品,但还不能证明它能替代专家教师。 Sean Jancipar预测,10年内不会再有孩子在没有随时可用的辅导老师陪伴下学习;这名老师了解学生的学习历史,并在获得许可后了解其兴趣。其目标对应Bloom的“2个标准差”提升,但保留意见也很明确:AI能否达到人类导师的效果,“仍有待观察”。

  • Khanmigo的先发优势来自优先模型访问权、机构信任,以及围绕GPT-4在3月14日发布而展开的限期冲刺。 Khan Academy从10月在Slack上偶遇一个感觉像“全知全能存在”的模型,推进到Chrome扩展原型、学生测试、OpenAI红队测试和全员1月黑客松。Sean说,产品发布后,有些观察者反问,既然Khanmigo已经做得很好,又拥有教育品牌和信任,为什么还要与之竞争。

  • 模型栈仍刻意重度依赖GPT-4,因为可靠的苏格拉底式教学比过早优化成本更重要。 GPT-3.5用于辅导“基本不可行”,因为它太容易无视“不直接给出答案”的指令;但在提取对话洞察、学生主动授权的兴趣等低风险任务上仍然够用。团队的运营原则是“专注于找到魔法”:与其把平庸产品交付给10,000人,不如先让10名用户真正惊喜,再在质量允许的地方换用更便宜的模型。

  • Khanmigo的差异化不在基础模型本身,而在教育语境、专家设计的行为和多轮调用推理。 练习题提供问题、正确答案和人工编写的提示;在数学场景中,Khanmigo先私下分析学生是否答对以及原因,再把分析结果交给另一轮独立的辅导回复。Khan Academy还帮助OpenAI标注了约100道发布前题目及其大量变体,提升的是GPT-4辅导时的连续性,而非原始算术能力。

  • 安全被视为产品层,而不是宣称GPT-4本身无法被越狱。 每条消息都可以加上保持任务聚焦的指令,并通过OpenAI的moderation API;教师和家长可以查看学生日志。当前个性化程度仍有限,但主动授权的兴趣提取和跨会话学习记忆已在路线图中;产品还会明确提示“Khanmigo有时会犯错”,并解释原因。

  • 分发围绕学校和教师增强设计,而不是让学生独自使用AI取代课堂。 Khan Academy按每名学生每月收费,重点服务免费及减价午餐学生占比较高的学校;当学区无力承担时,则提供折扣或寻找本地企业赞助。Nathan则通过每月9美元的定期捐款获得个人访问权限。Marc Bhargava强调,目标是减少同时举手的人数,让教师有更多时间开展项目式教学,为英语学习者提供母语帮助,并在AI无法解决问题时进行个性化干预,而不是替代教师或课堂。

  • 真正可投资的结果仍是教学效果,而Khan Academy尚未证明Khanmigo具备这一效果。 用户参与度和学习时长只是早期信号,计划中的验证方式是比较使用普通Khan Academy的学生与同时使用Khanmigo的对照组在MAP Growth上的表现。语音、扫描作业、理解手写过程、分层小组、协作故事和AI辅助辩论等路线图功能扩大了产品覆盖面,但Sean最后仍给出有保留的判断:他认为Khanmigo可能帮助改变世界。

精读

1. GPT-4让遥远的辅导假设变成了眼前的产品决策

  • 大约在10月、ChatGPT发布前,Sean Jancipar意外被拉进一个包含GPT-4的Slack频道。与这个感觉像“全知全能存在”的模型相处30分钟后,他绕着街区走了一圈来消化其影响;但之后的经历修正了最初印象:“我们还没有AGI”,即便这个模型看起来仍足以改变世界。

  • Khan Academy最初的直觉是把这项技术隔离在学习者之外。更安全的应用似乎是内容生产、教师教案或其他员工工具,因为直接开放给学生会带来尚未解决的风险;发现OpenAI的moderation API后,一个经过谨慎控制的学习者产品才显得更可行。

  • 突破性原型来自Khan Academy团队成员Jessica。她做出了一个更智能的搜索或“礼宾”概念,用于把学习者引导到相关内容。周会一次次没有进展后,团队转向虚拟快速原型开发;一个粗糙的Chrome扩展把每个Khan Academy页面的上下文交给模型:学习者说“我不太懂这个”,模型能理解“这个”指的是什么,成为一个“站在旁边的引导者”。

2. 学生需求最终聚焦于相关性,而不只是正确答案

  • 第一次学生试用在Khan Lab School进行,事先取得了家长同意。由于当时ChatGPT尚未公开,学生原本以为会遇到一个基础而令人失望的聊天机器人;结果他们被模型的能力吓了一跳,最强烈的兴趣集中在一个按钮上:“我为什么要在乎这个?”

  • Jancipar把这一偏好视为对传统教学的批评:这个功能之所以受欢迎,“恰恰说明我们在教育中解释材料为什么重要这件事上做得有多好”。后来,他设想利用足球等经用户授权的兴趣,让解释更能激发个人动机。

  • 随后,Khan Academy进入OpenAI办公室,参与红队测试、路线图设计和数学可靠性工作。到1月,公司让大量员工签署保密协议,举行全员黑客松,收敛出最有潜力的实验,并将大部分工程、设计和产品资源投入到3月14日与GPT-4同步发布的产品中。

  • 模型选择直到最后阶段仍不确定。OpenAI每周都在产出新版本;一些合作方偏好故事讲述能力更强的模型,而Khan Academy想要更擅长数学的候选版本。一次由管理者、工程师和设计师共同参与的周末测试发现,最终投入生产的模型兼具“两个世界的优点”,而备用模型不太符合Khan Academy的要求。

3. 掌握式学习为AI导师提供了因果逻辑

  • Jancipar把产品锚定在Benjamin Bloom的“2个标准差”研究上,这也是Khan Academy长期教学法的一部分。他说,即使一个教师面对30名学生,单靠掌握式学习也可能带来至少1个标准差的提升;而一对一辅导叠加掌握式学习,才代表理想结果。

  • 掌握式学习意味着,在理解先修知识或至少达到熟练程度之前,学生不能继续推进。传统体系下,一个在Algebra 1拿到C的学生仍会进入Algebra 2,即使身上带着知识缺口;同样,漏掉一节课也可能让下一部分内容变得无法理解,因为后续每一步都默认学生掌握了前面丢失的内容。

  • Khan Academy的视频已经缓解了这种失败模式:学习者可以暂停、倒回并重做,“不会受到评判”。AI导师进一步增加了即时诊断、对话,以及最终记住学习历史的能力——它可以识别某个具体弱点,并在课程继续叠加之前及时处理。

  • Jancipar预测,10年内每个学习者都会拥有一名按需调用的导师,了解其历史,并在获得同意后知道其对Avengers或足球等事物的兴趣。但他没有预先声称能够达到“2个标准差”的结果:今天,高水平的人类专家仍然更强;GPT-4仍会犯数学错误;完美的数学可靠性仍是“尚未解决的研究问题”。

4. GPT-4承担辅导,更便宜的模型处理外围工作

  • Khanmigo目前仍几乎完全由GPT-4驱动。它能遵循“采用苏格拉底式教学,不要直接给出答案”的指令至关重要;GPT-3.5对这一约束的执行还不够可靠,用于核心辅导“基本不可行”。Llama 2值得探索,但路线图上的机会成本让它尚未成为优先事项。

  • 低风险活动构成Jancipar所谓的“演示碟片”:学习者可以共同写故事,或与历史人物对话,然后再把这些互动嵌入相关课程。在这些场景中,严格的教学控制不如练习题、测验、文章或视频旁边那么重要,因此有些任务可以容忍GPT-3.5。

  • 成本优化要服从产品发现。Jancipar提到创业公司从0到1的过程,以及“让10个人非常喜欢你的产品”胜过把平庸产品交给10,000人的原则;团队内部的说法是:“我们就专注于找到魔法。”只要可能,团队就用GPT-3.5处理教师洞察、偏题检测和用户主动授权的兴趣提取,因为GPT-4贵得多。

  • 作文工具体现了产品如何超越聊天:Khanmigo可以直接高亮需要语法或拼写修改的段落,而不是在来回对话中笨拙地描述问题位置。Nathan还提供了一个来自自身工作流的模型多样性案例:在输入过往样本和当前文字稿后,Claude 2生成播客开场白的风格起点比GPT-4更好。

5. 在指标成熟前,教育专家先塑造了辅导行为

  • Jancipar澄清了一个看似矛盾之处:生产版Khanmigo没有经过微调,会反复传入文章或练习题上下文;但在GPT-4发布前,Khan Academy曾直接参与OpenAI的强化学习流程。Sal Khan和内容专家评估了约100道题目及大量变体,将糟糕、良好和中等水平的辅导回复区分开来。

  • 反复出现的缺陷在于对话,而不只是计算。模型问完下一步后,可能看到学生写出的方程式,却把它当作一个无关的新问题,而不是自己刚才提问的答案。Jancipar强调,Khan Academy的反馈实质性改善了GPT-4的连续对话能力——让它更擅长辅导数学,不一定让它更擅长做算术。

  • 产品开发同样从瀑布式交接转向受《Creative Selection》启发的演示驱动模式,这本书讲述了iPhone的构建过程。设计师、工程师、产品经理、学习科学家和内容专家被安排在一起反复原型、演示、批评和迭代,因为没有一份完整需求文档能够事先写清楚理想导师应当是什么样。

  • 管理理念变成“数据知情”,而不是一味“数据驱动”。团队仍然标注对话,以衡量Khanmigo何时有帮助、何时失败;但对于可逆原型,专家判断可以缩短循环,只有正式的效果声明仍需要严格数据。Nathan的提醒很准确:如果没有人阅读底层对话记录,聚合基准可能会误导。

6. 可逆实验快速推进,基础设施选择则放慢决策

  • Khan Academy正式区分了单向门和双向门。Khanmigo以实验性Khan Labs的名义发布,目前仍是与参与学区合作的试点,因此可以根据证据随时调整功能;如果事实证明它辅导string theory非常糟糕,团队可以在真实使用中学到东西后将其关闭。

  • 相比之下,Python 2在Google Cloud停止维护迫使团队迁移后端,这是一个单向门。选择Go并将单体应用拆成服务,需要仔细分析开发者生产力和服务器费用,因为逆转语言决策的成本很高。如今,公司层面的决策记录会记录重大战略变化;这套框架来自Amazon,原则是“复制并定制”。

  • 早期推进也意味着要自行建设后来其他地方才提供的基础设施。Khan Academy最初用定制Google Sheet做标注,开发了自己的提示工程界面,并在研究提示词变更的回归测试。如今团队正在围绕LangChain重写大量代码,以便更容易切换模型和返回JSON,同时考虑采用专门的外部标注产品。

  • Jancipar对技术债务的辩护很直接:“有时候技术债务是好事。”赶上GPT-4发布很重要,即使更干净的架构从长期看可能降低总体开发成本;早期执行力、Khan Academy的品牌和信任,已经让一些观察者得出结论:“我为什么还要进入这个领域?”

7. 私有推理将模型能力边界向外推

  • Nathan用一个涉及微妙物理推理的船与水线问题测试了能力边界,随后追问:对于Khanmigo无法处理的学科,是否应该让它消失。Jancipar的答案是广泛开放、明确披露它会犯错,然后继续学习。大学高年级学生通常应该能识别无效帮助;真正的问题是:“这会伤害任何人吗?”以及如何降低这种伤害。

  • 对数学消息,Khanmigo可以先发起一次调用,判断主题是否属于数学;如果是,就私下推演学生的答案、练习题上下文、正确性和可能的误解。这个类似私人导师的分析不会展示给学习者,而是传给第二次调用,由后者据此进行辅导;Jancipar说,这显著改善了表现。

  • Nathan把这种隐藏式自我批评与Tree of Thoughts联系起来:后者会探索多条推理分支,再从中选择,但token数量可能呈乘法增长。Jancipar称chain-of-thought是一项已落地的技术,但没有说Khanmigo正在使用Tree of Thoughts。

  • 可靠性取决于上下文。练习题辅导效果最好,因为Khanmigo拿到了问题、答案和人工编写的提示;开放式的“Tutor Me: STEM”没有已知答案,因此更弱。一个潜在修复方案是先通过Wolfram或Python后端解出问题,注入结果和步骤,然后再开始辅导。

8. 检索和缓存设计同时降低幻觉与推理成本

  • Khanmigo的内置知识库最初收录的是基础模型无法回答的、关于Khanmigo自身的问题。例如,“AI Power”是每日额度,上限为200,000 tokens,足以覆盖普通使用,主要目的是防止滥用,但成本也是考量。当传入问题超过相似度阈值时,相关产品信息就会被注入提示词。

  • 早期检索实验暴露了失败模式:自动推荐的链接可能把一名Algebra 2学习者导向MCAT课程。由于价值不足,该功能被暂时移除,但团队仍希望在学习者确实需要某项Khan Academy资源时,能够可靠地插入链接。

  • 一个专用的OpenAI实例提供了额外缓存。OpenAI建议把最大的共享提示词前缀放在最前面,把用户特有变量移到末尾;按此方式重组提示词后,缓存命中率“显著提升”。Nathan提出了NVIDIA GPT-4 Minecraft代理的类比——把成功方案保存为可复用模块;但Jancipar提醒,团队首先需要理解学生问题的各种排列组合。

9. 安全、记忆和透明度是不可分割的产品要求

  • 防越狱能力来自GPT-4和Khanmigo的编排机制。用户消息可以加上保持任务聚焦的提醒,每条消息也都会经过OpenAI的moderation API,检测色情或其他不当内容等信号。Nathan形容,从早期版本到当前状态是“天壤之别”;Jancipar说,OpenAI一直在持续迭代,包括6月模型,但没有声称更广泛的安全问题已经解决。

  • 生产环境中的个性化仍然很有限:学习者可以选择简单、复杂或教授式的阅读风格,练习题上下文则可能标注其陌生、熟悉、熟练或掌握程度。系统还没有建立长期愿景中那种完整的学习者画像。

  • 路线图包括主动授权的兴趣提取,以及跨学习线程的连续性。一名学生先讨论sine,随后转到tangent,却因新的后端对话再次询问她了解多少sine而感到不满:“我10分钟前就告诉过你关于sine的事了。”Jancipar指出,对用户而言,这段学习旅程应当感觉连续,即使系统在后台开启了新线程。

  • Khan Academy也在教用户理解系统本身。Jancipar回忆说,一门面向教师或学生的AI课程可能在3月上线,相关支持材料也会进入知识库。界面会提示:“Khanmigo有时会犯错——原因在这里。”学生还会被明确告知,教师和家长可以查看他们的日志;Jancipar认为,这是建立家庭信任的必要条件。

10. 语音和课堂编排将Khanmigo扩展到聊天之外

  • 文字转语音的优先级很高,因为即使简化回复,内容仍然高度依赖文字。一个7年级学生可能只有5年级甚至2年级的阅读水平,这会让一个能力很强的文字导师变得难以使用;Khan Academy正在测试不同供应商和多种声音,也可能把可解锁的声音作为提升参与度的机制。

  • 视觉输入可以让学习者在移动应用中扫描作业,或直接在触屏上书写数学过程。Jancipar偏好的干预方式不一定是在第一次出错时打断学生:重复犯错后,Khanmigo可能会问学生为什么选择这一步,在保留有效挣扎的同时引出其误解。

  • 教师已经拥有一套教师端系统,用于生成教案、制定差异化学习计划,并洞察学生在哪些地方遇到困难;Jancipar说,许多教师认为它节省了有意义的时间。学生对一个随时可用、不会评判自己的导师反应积极;对英语不是母语的学习者而言,能够用自己的母语与Khanmigo讨论困难内容尤其有价值。

  • Marc Bhargava否定了让孩子从1年级到12年级都独自坐在电脑前学习的未来。目标可能是把10只举起的手减少到大约2只,让教师腾出时间建立关系和开展项目式教学。未来的多用户活动可以按共同误解给学习者分组,让全班共同创作故事,或让AI辅助并评分辩论。

11. 教学效果与公平分发仍是决定性考验

  • 早期评估会观察学习者是否在Khan Academy上花费更多时间、覆盖更多材料;即便是创作故事,也可能强化阅读理解。但Jancipar仍称标准化评估是“圣杯”,没有给出Khanmigo效果结果的时间表。

  • Khan Academy已有与NWEA合作使用MAP Growth测试的先例。系统读取分数,在测量和几何等领域分配个性化目标,学生按自己的节奏练习;后续测试显示,相比未使用Khan Academy的学习者,他们取得了具有统计显著性的提升。Khanmigo拟开展的研究,将比较普通Khan Academy用户与同时使用相同内容和Khanmigo的学生群体。

  • Khanmigo目前还不是免费产品;Jancipar说,它仍显著便宜于真人导师。学区按每名学生每月付费,而Khan Academy优先服务免费或减价午餐学生占比较高的学校,提供访问折扣并招募本地企业赞助商。团队考虑过建立会员梯度,让支付更高费用的支持者补贴长期资源不足学习者的许可证;Nathan个人则通过每月9美元的定期捐款获得访问权限。

  • Jancipar最后使用了“瑞士奶酪缺口”这个比喻:Khan Academy过去发现学习缺口的方式,大致是对可能弱点进行O(log n)搜索;AI导师则可能直接定位缺失技能,把学习者送回与年级匹配的水平。视频让所有人都拥有“Sal这位世界的老师”;Khanmigo则可能在规模化的同时增加个人关注。他的信念仍带有保留:“我认为他们会证明,这确实能帮助学生;我也认为它可以帮助改变世界。”