微软与伊利诺伊大学用“模拟学生”训练AI导师,棋类、英语、数学三项测试超过GPT-5.4
StudentSim为每个学生建立数字副本,在仅有几篇作文的数据下学会犯同样的错并接受提示;用它训练的象棋导师在专家评分中三项指标全部最高,但研究者称这只是概念验证。
AI解读:AI导师的训练长期以来受制于一个瓶颈:找一大群真实学生来提供反馈既贵又慢,导致导师能力的改进落后于底层模型的进步。StudentSim的做法是给每个学生造一个数字副本,用副本代替真人来给导师练手。
关键难点在于学生副本要同时会两件事:像本人一样犯错,以及在导师提示后像本人一样改答案。之前的方法只能做到其中一件——要么忠实复现行为但听不懂讲解,要么能跟着提示走但根本不像那个学生。
研究者的解法是两阶段训练。第一阶段从全体学生的汇总数据里学共同模式和典型错误,第二阶段只用某个人仅有的几条记录做适配。这样即使一名学生只写过三篇作文,也能建出可用的副本。
测试覆盖60名学生的象棋、英语和数学记录,StudentSim在三个科目上都超过了被提示扮演学生的GPT-5.4。象棋场景里,三名真人选了三种不同的走法,StudentSim分别预测正确,专用象棋模型对三人给出同一步,GPT-5.4三步全错。
概念验证的另一半是反向使用:用模拟学生去训练象棋导师。真人职业棋手评估三个版本,StudentSim训练的导师在事实准确性、讲解质量和个性化适应三项上得分最高;用GPT-5.4当学生训练出的导师,事实准确性反而比不加训练的版本更差。
研究者明确表示这只是概念验证,不是宣称做出了最好的导师。象棋能作为测试用例是因为引擎可以客观判断走法好坏,作文和开放式数学缺少可靠评分函数,难度更高。代码已在GitHub公开。
微软与伊利诺伊大学的研究团队提出StudentSim系统,用学生的数字副本来训练AI导师,替代昂贵且耗时的真实学生反馈。相关论文称,AI导师的改进速度落后于底层模型的进步,症结就在于难以获得大规模、多样化的学生训练数据。
StudentSim的核心要求是学生副本具备两种能力:忠实复现该学生的答案和典型错误,以及在导师给出提示后按其真实水平修正答案。研究者称,已有方法通常只具备其中一种——有的能从真实数据学习并可靠复现行为,但无法利用导师的讲解;有的是被提示扮演学生的语言模型,能跟着提示走,却不像它该模仿的那个学生。
系统把这些能力变成可测量目标:副本与目标学生答案的接近程度(包括典型错误),以及接受导师帮助后修改答案的积极程度。
数据稀缺是最大障碍。在英语写作数据集中,学生作文数的中位数仅为三篇,超过三分之二的学生写了五篇或更少。研究者称,直接在这点样本上训练副本会因过拟合而失败。
两阶段训练:先用全体数据打底,再用个人记录适配
StudentSim分两步训练。第一阶段,基础模型从某一科目全体学生的汇总数据中学习共同错误模式,以及学生在收到导师提示后如何修改答案。第二阶段,用该学生仅有的少量记录把模型适配到个人。
所有科目均以阿里巴巴的Qwen3-4B-Instruct语言模型作为基础模型。
象棋、英语、数学三项测试均超过GPT-5.4
研究者在象棋、英语作为外语和数学三个科目上测试该方法,涉及60名学生,使用的是包含真实学习者记录的公开数据集。当GPT-5.4被提示扮演学生时,StudentSim在三个科目上均超过这个规模更大的模型。
象棋场景最直观:StudentSim预测玩家下一步走法的准确率约为GPT-5.4的两倍,并且几乎总能遵循纠正性指导。研究者称,GPT-5.4和专用象棋模型都落后。在一个局面中,三名真人玩家选择了三种不同的走法;Maia2对三人预测同一步,GPT-5.4三步全错,StudentSim则分别预测正确。
- 英语写作数据集中,学生作文数中位数为三篇,超过三分之二不超过五篇
- 象棋测试:StudentSim预测下一步的准确率约为GPT-5.4的两倍
- 同一局面三名真人三种走法,StudentSim三人全部预测正确,GPT-5.4三人全部错误
用模拟学生训练象棋导师,专家评分三项最高
作为另一项概念验证,研究者用学生副本去改进一个象棋导师。职业棋手评估了三个版本:未经该训练的、用GPT-5.4当学生训练的、用StudentSim训练的。
StudentSim训练的导师在全部三项指标上得分最高:严重事实错误最少,讲解质量和对个体学生的适应度得分最高。论文提到,在这个案例中学生更喜欢引导其自行找到解法的问题,而非直接指令。
值得注意的是,用GPT-5.4当学生训练出的导师,在事实准确性上比完全没有额外训练的导师更差。
研究者的边界说明与后续计划
研究者称这只是概念验证,不是宣称已经造出最好的导师。象棋之所以适合作为测试场景,是因为引擎可以客观判断任意局面下走法的好坏;作文写作和开放式数学更难,因为自由形式的答案缺少可靠的评分函数。
团队下一步计划建模学生在多次练习中如何习得、保持和遗忘知识。代码已在GitHub上发布。
文章还提及相关背景:2024年有研究者基于每人两小时的访谈,用AI代理复现约1000名真人;另一项独立研究显示这类副本容易出错——九个开源语言模型在X、Bluesky和Reddit上模仿用户行为,内容越像人,准确度越低。微软也在真实学生中测试AI导师,尼日利亚一个试点项目中,学生每周使用Copilot两次、持续六周,测试成绩提升相当于近两年的额外学习。OpenAI的Study Mode和Google的Guided Learning提供各自的学习模式,依赖系统指令和针对教学微调的模型,但两者都不维护个体学习者的模型。
- 研究者称StudentSim只是概念验证
- 适用于有客观评分函数的场景(如象棋引擎),作文与开放式数学尚缺可靠评分函数
- 下一步:建模学生知识随时间习得、保持和遗忘的过程
- 代码已在GitHub公开