TutorMoments: Do AI tutors know when to help and when to hold back?
TL;DR · AI 摘要
TutorMoments框架揭示AI导师过度帮助学生,明确提示权衡可提升表现但未达人类水平,开源数据集与代码促进教育AI研究。
核心要点
- TutorMoments使用真实数学辅导数据评估AI导师,发现模型过度帮助学生
- 明确提示帮助与退后权衡可提升模型表现,但未达人类水平
- 开源数据集、代码和模型重放,促进AI教育研究的可重复性
结构提纲
按章节快速跳转。
- §引言
介绍TutorMoments框架的教育AI评估目标与核心问题。
- ·核心机制
基于真实数学辅导数据构建评估框架,模拟AI导师决策过程。
- ›实验结果
发现模型过度帮助学生,明确提示可提升但未达人类水平。
讨论AI导师在帮助与退后权衡中的技术挑战与优化方向。
- ›开放资源
发布数据集、代码和模型重放,推动教育AI研究可重复性。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- TutorMoments框架
- 核心机制
- 真实数学辅导数据
- 实验结果
- 模型过度帮助
- 提示优化效果有限
- 开放资源
- 数据集
- 代码
- 模型重放
金句 / Highlights
值得收藏与分享的关键句。
TutorMoments使用真实数学辅导数据评估AI导师的决策,发现模型过度帮助。
明确提示帮助与退后权衡可提升模型表现,但仍有差距。
开源数据集、代码和模型重放,促进AI教育研究的可重复性。
TutorMoments:AI导师是否知道何时帮助学生,何时需要保持克制?
返回文章列表
[0
[-1
企业
]
文章
2026年8月7日发布
点赞
12
[
- +6
Kyle Wiggers
Ai2Comms
关注
📄 技术报告:https://tutormoments.allen.ai/static/paper/tutormoments-preview.pdf | 📊 数据集:https://huggingface.co/datasets/allenai/tutormoments-preview | 💻 代码:https://github.com/allenai/tutormoments
今天,我们发布了 TutorMoments 的预览版,这是一个用于评估前沿大语言模型(LLMs)是否能够平衡教育中最难取舍之一的框架:何时介入帮助学生,何时保持克制让学生自行完成更多思考。
TutorMoments 是基于真实一对一数学辅导课程的重放式评估系统。经验丰富的数学教师会分析从美国辅导项目中收集的对话记录,并标记出导师需要在简化问题以帮助学生入门与推动学生自主思考之间做出抉择的关键时刻。TutorMoments 会将对话记录截取到这个决策点,将其输入语言模型,让模型在模拟课程中扮演导师角色(学生由另一个语言模型扮演),观察LLM导师会如何应对。
仅告诉模型“要成为一名优秀的导师”时,我们发现模型倾向于过度帮助,提供过多支持,而很少推动学生进行深度思考。在导师提示中明确说明这种权衡(何时帮助与何时克制)可以提升表现,但与人类导师始终能精准把握时机的表现相比仍有差距,LLM在判断这一取舍时仍存在显著差异。
作为对开放研究的承诺,我们发布了去标识化的辅导对话数据集、运行重放流程的代码,以及我们评估对话中关键时刻的模型导师重放结果,以确保研究的可复现性。我们希望 TutorMoments 能为教育工作者、研究人员以及开发AI导师的团队提供更精准的评估方式,帮助他们探讨模型在最关键的教学决策上的表现,并推动教育领域开发能够适应每位学生需求的导师系统,而非代替学生完成学习任务。
优秀的导师应具备什么特质?
向一位优秀的数学导师求助时,你可能会收到类似的问题:“你对题目要求了解多少?”这并非不帮助,教学的重要部分在于诊断学生已有的知识,并在当下提供恰当的支持。立即提供帮助会剥夺学生通过自主思考获得学习机会。有时需要支持,但有时最有效的方式是通过解释正确答案来巩固理解。
然而,语言模型经过训练以提供帮助,而一个乐于助人的助手往往倾向于为你完成困难的部分——解释概念、列出步骤并引导你得出答案。在辅导课程中,这种行为可能会缩短富有成效的挣扎过程——这种充满挑战甚至令人沮丧的问题解决过程,已被学习研究长期证实与更深层次的理解密切相关。
大多数将语言模型作为导师的基准测试未能捕捉到这种张力。它们往往只奖励某种特定行为——比如从不透露问题答案,或总是提供提示——却未考虑这种行为是否符合学生实际理解水平的正确选择。但优秀的辅导并非一种可以统一适用的固定行为,而是一种判断:在这个问题上,这位学生现在最需要什么?
TutorMoments 的运作方式
TutorMoments 基于真实辅导数据构建。我们发布的数据集 TutorMoments-Preview 包含 462 段经过脱敏处理的纯文本一对一数学辅导对话记录,对象是美国 2-7 年级学生,包含超过 1500 个教师标注的关键时刻,以及来自 27 位美国教师标注者的数千条自由文本注释。这些对话记录来自一个高剂量辅导项目,学生主要就读于 Title I 学校,数据在家长和监护人同意的研究条款下共享;所有数据首先由提供方剥离识别信息,随后通过额外的数学感知流程再次处理。
所有注释均由经验丰富的数学教师完成,我们要求他们阅读对话记录并标记关键学习时刻——记录当时发生了什么,导师采取了什么行动,以及学生对此的反应。每个关键时刻都是一个决策点,导师需要在支架教学(使问题更易理解)与追求严谨性(鼓励学生进行更深入的思考)之间权衡。
TutorMoments 的运作方式是:在关键时刻暂停对话记录,并将会话交给语言模型处理。模型以导师身份与模拟学生进行五轮对话。我们将这些模型生成的对话延续称为“重演”。随后,基于大语言模型的评分管道会从三个维度对每次重演进行评分:(1)当学生需要支持时是否提供了支架教学,(2)当学生准备接受更高挑战时是否推动了严谨性,(3)是否避免了过度支架教学(减少的挑战程度超过该时刻实际需求)。
评分管道以教师定义的“真实情况”为起点:对每个关键时刻判断是需要支架教学还是需要推动严谨性。每个关键时刻由多位教师标注,当出现分歧时采用多数意见——例如三位教师标注某个时刻,其中两位认为需要推动严谨性而一位认为需要支架教学,则最终判定为推动严谨性。随后,一个独立的语言模型分类器会验证教师标注,判断导师的实际行动是否与关键时刻需求匹配——“恰当”的行动意味着导师的分类行为(支架教学、推动严谨性或过度支架教学)与教师判断的时刻需求一致。
初步结果
我们使用两种提示对七种大语言模型进行了 TutorMoments 测试:一种是普通提示,仅要求模型根据对优秀辅导的理解进行回应;另一种是评估感知提示,明确说明支架教学、过度支架教学与推动严谨性之间的权衡。每个模型的评分基于辅导对话记录中的关键时刻,这些关键时刻被均等地分为需要支架教学和需要推动严谨性的两类。
表格中的每个数字都是0到1之间的评分,表示模型在相关情境中做出正确决策的比例——因此,得分越高意味着模型做出正确判断的频率越高。例如,严谨性评分为0.50意味着在需要严谨性的情境中,模型有一半的时间推动了严谨性。
阅读这些评分时需要注意以下几点:
人类导师是自然参照标准,而非上限。我们不将人类导师视为理想实践的模板——即使经验丰富的导师在关键时刻也可能做出非最优选择。如果在相同决策点以相同方式评分,我们转录文本中的人类导师得分分别为0.458(适当支架式教学)、0.182(适当严谨性)和0.496(避免过度支架式教学),这些分数均低于模型的评估感知得分,且与模型的普通提示得分范围相当。但这并不是说AI导师的表现优于人类教师。标注人员特别关注了辅导可能改进的时刻,因此数据集侧重于未抓住的机会,而非理想实践。
这些评分衡量的是导师行为,而非学习效果。重播使用的是模拟的"神谕"学生,因此这些数字反映的是模型在决策点的行为,而非真实学生是否真正学到了知识。
严谨性评分的波动性大于支架式教学。评分流程对严谨性推动的检测可靠性较低,且基础标注中严谨性时刻(260个)少于支架式教学时刻(738个)。
表格中最明显的模式是提示语的重要性:所有模型在评估感知提示下的得分均高于普通提示下的得分。这表明模型默认的"乐于助人的助手"行为本身不足以实现良好的辅导效果。但仅在提示中明确说明权衡关系的作用有限——虽然所有评分都有所提升,但不同模型对增强提示的理解仍存在显著差异,即使表现最好的模型仍有很大改进空间。
我们还分析了每种情境下导师采取的策略。尽管提示语鼓励模型推动严谨性,但它们使用的策略比人类少,通常更多依赖于让学生解释答案。相比之下,人类导师使用更多样化的策略,更有可能退后一步让学生独立完成任务。
局限性与下一步计划
TutorMoments目前仍处于早期开发阶段,现阶段存在若干局限性。最大的局限是自动化评估只能提供模型在决策点行为的信号,但无法替代真实学生和真实学习成果的研究。数据集本身也较为狭窄:主要基于美国的小学和初中数学,由单一教育者团队标注。我们的研究结果可能无法推广到其他学科、年级或教学环境。
我们分享这个预览版本是为了在构建更大规模的多模态数据集、更强的评分流程和更深入的分析过程中收集反馈。
致谢
本项目部分得到了比尔及梅琳达·盖茨基金会和Learning Commons的支持。
本文提到的数据集 1
更多该作者的文章
OlmoEarth平台:行星尺度的地理空间推理
40
2026年7月28日
构建Shippy教会我们的代理构建经验
21
2026年7月15日
社区
编辑
预览
通过拖拽文本输入框、粘贴或
点击此处
上传图片、音频和视频。
轻点或粘贴此处上传图片
评论
· 注册或登录以发表评论