StudentSim 试图解决一个长期存在的问题:AI 教师已经能完成不少单次教学任务,但教学效果不能只看教师端,关键反馈发生在学生端。

一道数学题,模型可以拆解步骤;一篇英文作文,它也能指出语法问题;一盘棋,它还可以解释下一步思路。很多场景里,这类输出已经很像耐心助教。问题在于,学生听完之后有没有改正错误,是否只是照着提示走,同一句讲解面对不同学生会不会产生不同结果,这些都要靠学生反应来判断。
现实中,这类反馈主要来自 human study。教学策略每次调整,都要组织学生参与、收集交互,再由人工评估。AI 模型更新速度很快,教育反馈的获取速度却受 human study 实验周期限制。StudentSim 的思路,是把真实学生记录转成训练阶段可以反复调用的代理反馈。
论文题为 StudentSim,研究团队希望让 AI 教师更好理解学生的优劣势,并针对不同学生给出合适指导。项目把问题落在学生模拟器上:能否用真实学生数据训练出可评估、可复用的 AI 学生,让 AI 教师在训练阶段拿到更多反馈。
论文链接为 https://arxiv.org/abs/2609.01591,代码已发布在 https://github.com/microsoft/StudentSim,Hugging Face Paper 页面为 https://huggingface.co/papers/2609.01591。
学生模拟器为什么重新受到关注
这项工作并不是孤立个案。User simulator 正在成为热门研究方向,已经进入客服、电商、医疗问诊、网页操作等场景。研究者会构造模拟用户,让 agent 在上线前经历更多交互,用于测试策略、话术和鲁棒性。
教育场景里的用户模拟更复杂。学生通常有相对稳定的知识边界、错误习惯和学习轨迹。同一道题,有人会算错符号,有人会误解概念;有人读完提示后能自己推到答案,有人则需要更直接的指导。近来被讨论的人类学生数字孪生,也围绕这类需求展开。

旧方法的问题不在建模,而在自然语言指导
建模学生并不是新题目。从 1995 年的贝叶斯知识追踪,到深度知识追踪,再到注意力知识追踪,这条路线已经探索了近 30 年,在拟合学生行为上相当成熟。
但这类方法有共同缺口:模型只接收题目、状态、能力值等结构化输入,没有接收自然语言指导的入口。教师说了什么,它们无法交互,也无法像真实学生那样因为指导而改变表现。
另一条常见路线,是直接让大模型扮演学生。只要给出一句「你是一个数学基础薄弱的小学生」,模型就能立刻换成低龄学生口吻,也能表现出犹豫和不确定。
问题在于,角色语气和认知水平并不同步。模型可以先说「我不太懂」,下一句却给出微积分级别的推理。它看起来在扮演学生,实际反馈仍然受自身知识储备影响,能力水平可能远高于设定的人设。
如果这类模拟器被用于训练 AI 教师,教师拿到的就不是某个学生在当前能力边界下的反应,而是高能力模型经过人设包装后的输出。研究指出,仅靠一段能力描述去约束大模型,对它来说是一条很脆弱的条件通道。近两年,这条路线被大量用于教育场景,包括对话辅导语料、多智能体课堂、学习者数据生成;同时,也有一批专门检验其效度的研究出现,分别从架构、保真度基准和教师使用体验三个角度提出质疑。
StudentSim 把学生能力拆成两部分
教育学里,一次指导是否有效,通常不能只看学生独立作答时的表现,也要看学生接受帮助后能走多远。

Vygotsky 提出的最近发展区讨论的就是这件事:学生当前能独立完成什么,在教师支持下又能完成什么,这中间的差距反映了教学可以介入的空间。后来,动态评估把这一想法变成可操作的测量程序,不只记录学生答对与否,也观察提示给出后表现如何移动。
放到学生模拟器上,对应的是两类能力。第一类,是复现学生独立作答时的状态,包括能力边界、错误习惯和常见选择;第二类,是在读到教师指导后产生相应变化,表现出这个学生在帮助下可能出现的更新。
StudentSim 据此把个性化学生模拟器的训练与评估,拆成 behavioral fidelity 和 guidance responsiveness 两个维度。前者看独立作答时像不像目标学生,后者看接受指导后会不会产生相应变化。
训练流程分两步,先学群体再适配个人
StudentSim 的训练流程分为两步。
第一步,团队汇总一个领域内多名学生的记录,先训练通用学生行为模型。这个阶段主要学习共性错误、回答格式,以及接受指导后的修正路径。
第二步,再使用单个学生自己的记录继续训练,得到个性化模拟器。原因也很直接:单名学生记录较少,直接训练容易过拟合;先学习群体规律,再适配个人数据,更容易稳定获得每位学生对应的模拟器。

StudentSimEval 覆盖 60 位真实学生
为了配套评估,研究团队还构建了 StudentSimEval。评估覆盖 60 位真实学生,场景来自国际象棋、第二语言英语写作和基础数学。
三个任务的形式不同,但评估目标一致。
- 国际象棋中,模拟器要预测某位玩家在棋局中的走法,并在教练指导后改走位。
- 二语写作中,模拟器要生成符合学习者错误模式的作文,并根据教师批改改写片段。
- 数学中,模拟器要预测学生答案,并在讲解后修正。
所有方法都拿到同一份学生记录,并在相同的 held-out 测试记录上比较。先看模拟器是否像学生本人,再看它能否响应指导。
国际象棋结果:StudentSim 两项指标同时更高
国际象棋结果里,StudentSim 的 F 为 0.5150,R 为 0.9067;GPT-5.4 分别为 0.2316 和 0.7186;Maia2 分别为 0.4535 和 0.2721。二语写作和数学实验中,StudentSim 也在两个指标上超过对应基线。
这组结果呈现出比较清晰的分工。GPT-5.4 读得懂指导,但模拟具体学生时保真不足;Maia2 更贴近人类棋手走法,但没有自然语言指导入口;StudentSim 则通过真实学习记录训练,并对每位学生做个体适配,在行为保真和指导响应两方面同时获得提升。
论文把 StudentSim 接入 AI tutor 强化学习
研究团队没有把学生模拟器停留在评估层面。论文继续把 StudentSim 放入 AI tutor 的强化学习流程,检验它能不能用于改进教师模型。

以往训练 AI tutor,奖励信号有的来自专家标注的优质辅导对话,有的来自采用评分量表的通用大模型裁判。也有工作尝试把奖励接到模拟学生上,但使用的多是认知水平不保真的角色扮演式 LLM 学生,而不是在真实学习者数据上训练过的模拟器。StudentSim 提出的是另一条路径。
实验场景仍然是国际象棋。系统先取出真实学生犯过的错误走法,由 AI tutor 生成指导;StudentSim 读完指导后,再给出修正走法。
接着,Stockfish 用来计算修正走法相对原错误走法的质量变化,这个分数会回传给 tutor,作为 RL 信号。对照组包括无 RL 的 tutor,以及使用 GPT-5.4 作为学生模拟器 reward 的 tutor。
三组 tutor 使用相同的基础模型、SFT 起点和 GRPO 设置,差异只在 reward 来源。流程是:Tutor 生成指导,冻结的 AI 学生模拟器给出修正答案,系统依据修正前后的质量变化更新 tutor。
盲评结果:StudentSim reward 训练出的 tutor 排名第一
国际象棋评估者在盲评条件下比较三组 tutor。StudentSim reward 训练出的 tutor,在准确性、指导质量和个性化评分上均排第一。
专家在打乱呈现顺序后,对三个维度进行盲评:准确性看「没有误导性事实错误」的回答占比,指导质量和个性化各为 1 到 5 分。最终,使用 StudentSim reward 训练出的 tutor 在三个维度上都位居第一。

反向实验显示,不保真的模拟器会把教师带偏
论文里还有一组反向结果更值得关注:用 GPT-5.4 作为学生模拟器训练出来的 tutor,准确性不仅低于 StudentSim 方案,也低于完全不做 RL 的基线。拖累结果的,是明显更高的严重事实错误率。
研究给出的解释很直接:如果模拟器不保真,就会把教师往错误方向推。一个认知水平不符合真实学生、但理解能力很强的模拟器,哪怕读到离谱的指导,也可能自己推出某种答案。这样一来,错误指导也会得到随机奖励,RL 训练就会朝着混乱甚至错误的方向优化。
StudentSim 的定位仍在训练阶段
StudentSim 并没有要取代教育研究中的真实学生实验。它做的是把真实学生记录转成训练阶段可以反复调用的模拟反馈,让 AI tutor 在进入 human study 之前,先完成更多轮筛选和优化。
对需要个性化反馈的 AI 教师系统来说,这类学生模拟器延续了近期 user simulator 的研究思路,也指向人类数字孪生在教育场景里的具体工程化路径:学习学生如何出错,学习学生如何在指导下改变,再把这些变化转成教师模型强化学习可用的机器学习时间尺度反馈信号。
本文来自微信公众号「新智元」,作者为新智元,编辑为 LRST。

