网易首页 > 网易号 > 正文 申请入驻

微软×UIUC:给每个学生造一个「数字分身」,AI教师终于有了陪练

0
分享至



User simulator 正在进入 AI agent 训练流程。客服、电商、医疗问诊、网页操作等场景里,研究者会构造模拟用户,让 agent 在上线前经历更多交互,测试策略、话术和鲁棒性。

教育场景也需要这样的模拟用户,只是这里的「用户」,也就是「学生」,更难模拟:一个学生有相对稳定的知识边界、错误习惯和学习轨迹;学生模拟强调的是学生认知动态的保真,同一句指导,可能让一个学生改正错误,也可能让另一个学生只学会套答案。

这也是学生数字孪生受到关注的原因。AI 教师要学习个性化指导,需要看到学生对教学内容、教学策略的反应。真实学生反馈可以提供这些信号,而获取往往要通过学生参与人类测试,成本很高。

直接让大模型扮演学生,看起来是省事的方案。如果告诉它「你是一个基础薄弱的小学生」,模型可以立刻换成小学生口吻,也能表现出犹豫和不确定。

但角色语气和认知水平不是一回事。一个模型可以用低龄学生的语气回答「我不太懂」,下一句却给出微积分级别的推理。它看起来在扮演学生,实际反馈仍然受模型自身知识储备影响。

用于 AI 教师训练时,这种偏差会带来问题。AI 教师得到的不是某个学生在当前能力边界下的反应,而是一个高能力模型经过人设包装后的反应。

微软和 UIUC 近期的合作研究 StudentSim,正是从这个问题出发。教育学里评价一次指导是否有效,不仅只看学生独立作答时的表现,也要看学生在接受帮助后能走多远。Vygotsky 提出的「最近发展区」讨论的就是这件事:学生当前能独立完成什么,和在教师支持下能够完成什么,中间的差距反映了教学可以介入的空间。

放到学生模拟器上,这个思想对应两类能力。第一,模拟器要能复现学生独立作答时的状态,包括能力边界、错误习惯和常见选择。第二,模拟器要能在读到教师指导后产生相应变化,表现出这个学生在帮助下可能出现的认知状态的更新。

StudentSim 把这两类能力分别定义为 behavioral fidelity 和 guidance responsiveness,并用真实学生记录训练个性化学生模拟器。这样得到的 AI 学生,不只输出一个「像学生」的回答,还要能对教学指导作出可测的响应。



  • 论文标题:StudentSim: Training LLM-based Student Simulators
  • 论文链接:https://arxiv.org/abs/2609.01591
  • 项目代码:https://github.com/microsoft/StudentSim
  • 项目主页:https://microsoft.github.io/StudentSim/
  • Hugging Face Paper 主页:https://huggingface.co/papers/2609.01591

AI 教师正在变得越来越会讲题。但一个更难的问题是:它怎么知道自己讲得有没有用?

在真实课堂里,教师不能只输出答案。学生听完之后会不会改正错误,会不会暴露新的误区,会不会因为提示太直接而跳过思考,才是教学是否有效的关键信号。对于 AI 教师来说,这个反馈尤其昂贵。每改一次教学策略,都需要真实学生参与、等待他们完成学习,再用 human study 验证效果。这个过程往往以周为单位,远慢于今天大模型和 AI 教师的迭代速度。



这正是 StudentSim 想解决的问题:它是一个基于真实学生数据训练的个性化学生模拟器框架,目标是为每个学生训练一个对应的模拟器,让它既能复现该学生的错误和能力边界,又能在读到教师指导后产生合理更新。

研究团队同时提出 StudentSimEval,用统一协议评估学生模拟器的两个核心能力:behavioral fidelity 和 guidance responsiveness。前者衡量模拟器是否像目标学生,后者衡量它是否能在教师指导后向正确方向更新。

这两个指标对应了 AI 教师训练中最需要的两类信号:一个个性化起点,以及一个可被教学干预影响的学习动态。

为什么 prompt 一个 LLM 还不够?

过去的学生建模方法大致分成两类。

一类是知识追踪和行为预测模型。它们基于真实学习轨迹,通常后验记录学生状态。但这类方法缺少自然语言指导输入通道。换句话说,它们能比较精确地追踪学生过去怎么做,却很难回答「如果老师这样讲,学生会不会改」。

另一类是 LLM 角色扮演。给大模型一段充足的学生画像,让它扮演某个水平的学生,再让它读教师解释并给出反应。这类方法能流畅处理自然语言指导,但问题在于认知水平不保真。一个 LLM 可以用幼儿园语气说话,却仍然带着远超目标学生的知识和推理能力。

StudentSim 试图解决这两大问题:直接从学生数据中训练模拟器。



框架采用两阶段训练。第一阶段,将同一领域内多个学生的记录汇总,训练一个 domain-level base simulator,让模型学习该领域中常见的错误模式、回答格式和指导后的修正路径。第二阶段,再用单个学生自己的少量记录进行 specialization,得到一位学生对应的一支模拟器。

这种设计针对的是真实教育数据中的常见难题:单个学生的数据通常很稀疏,但同一领域里不同学生之间又共享大量结构性规律。StudentSim 先学习群体先验,再学习个体差异。

三个领域,60 个学生

为了避免只在单一任务上验证,研究团队构建了 StudentSimEval,覆盖国际象棋、第二语言英语写作和基础数学三个领域,共 60 名学生。

在国际象棋中,模拟器需要预测某个玩家在棋盘位置上的下一步走法,并在读到自然语言教练指导后更新走法。在二语写作中,模拟器需要生成符合特定学习者错误分布的英文作文,并根据教师修改建议改写片段。在数学中,模拟器需要预测学生会给出哪个解,并在读到教师指导后改正。

所有方法都在相同的 per-student training records 上拟合,并在相同 held-out records 上评估。

结果显示,StudentSim 在三个领域的 fidelity 和 responsiveness 上均超过最强可用基线。



例如,在国际象棋任务中,StudentSim 的 behavioral fidelity 达到 0.5150,高于 Maia2 的 0.4535,也明显高于 GPT-5.4 的 0.2316;guidance responsiveness 达到 0.9067,高于 GPT-5.4 的 0.7186 和 Maia2 的 0.2721。

这个结果也呈现出两类基线的典型短板。Maia2 能较好预测人类棋手的 move distribution,但没有自然语言指导输入通道,因此 responsiveness 较低。GPT-5.4 能读懂指导并做出响应,但无法稳定复现具体学生的能力、习惯和错误,因此 fidelity 较低。StudentSim 则同时提升了两项指标。

从学生模拟器到 AI 教师强化学习

论文还进一步验证了 StudentSim 能否作为 AI 教师训练中的反馈信号。



研究团队在国际象棋教学场景中构建了一个训练教师模型的 RL proof of concept。训练过程中,AI 教师根据真实学生记录中的错误走法生成指导;冻结的学生模拟器读到指导后输出修正走法;奖励函数根据修正走法相对原错误走法的 Stockfish 质量提升来更新教师模型。

对照组包括不做 RL 的 SFT 教师模型,以及使用 GPT-5.4 作为学生模拟器 reward 的 RL 教师模型。三组共享同一个 tutor policy、同一个 SFT 起点和相同 GRPO 设置,区别只在 reward 来源。

最终由 8 名国际象棋评估者进行盲评。StudentSim reward 训练出的 AI 教师在三项指标上均最高:accuracy 90.5%,guidance quality 3.31,personalization 3.93。相比之下,No RL 的 accuracy 为 75.7%,GPT-5.4 reward 为 71.6%。

研究团队强调,这并非是「最强 AI 教师」的声明,而是为了验证一个更基础的问题:一个同时具备 fidelity 和 responsiveness 的学生模拟器,是否能为 AI 教师优化提供有用的代理反馈。结果表明,StudentSim 作为 reward 来源,比单纯 prompt frontier LLM 更有效,也更适合本地部署和定制。

对 AI 教育系统来说,这意味着一个新的训练闭环:真实学生数据不只用于评估 AI 教师,也可以用于训练可复用的学生模拟器;这些模拟器再为 AI 教师的策略优化提供高通量反馈。

作者简介

杨可,UIUC 计算机第四年在读博士,导师为翟成祥教授,本科毕业于清华大学。研究方向为 AI agents、语言模型、信息检索与多模态基础模型,同时关注 AI 系统中的偏见与歧视问题。曾在 Amazon AWS、Microsoft Research Deep Learning Group、Google 实习。个人主页:https://empathyang.github.io

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
阿尔瓦雷斯道歉失效,锋线3场7球,他如何赢回球迷信任?

阿尔瓦雷斯道歉失效,锋线3场7球,他如何赢回球迷信任?

暗香暗香
2026-09-03 16:55:19
普京当着中方的面,主动开口说了这么句话:如果中国方面觉得可行,俄罗斯愿意把现在的中俄互免签证安排,直接升级成永久机制

普京当着中方的面,主动开口说了这么句话:如果中国方面觉得可行,俄罗斯愿意把现在的中俄互免签证安排,直接升级成永久机制

扶苏聊历史
2026-09-03 18:43:07
“林肯”号,“令人震惊”!

“林肯”号,“令人震惊”!

环球时报国际
2026-09-03 18:48:53
毛主席曾对尼泊尔首相说:你想把珠峰全部划归贵国?还有更好办法

毛主席曾对尼泊尔首相说:你想把珠峰全部划归贵国?还有更好办法

究竟谁主沉浮
2026-08-17 20:19:17
上海著名主持人宣布退休!网友集体回忆杀:一代人的青春,谢谢您的陪伴…

上海著名主持人宣布退休!网友集体回忆杀:一代人的青春,谢谢您的陪伴…

陈意小可爱
2026-09-04 12:11:47
武大“学术妲己”事件升级:男方现任安大副校长,校方回应

武大“学术妲己”事件升级:男方现任安大副校长,校方回应

娱圈观察员
2026-09-04 11:57:44
央视记者采访的贝壳“诚意卖”,在京沪杀疯了

央视记者采访的贝壳“诚意卖”,在京沪杀疯了

易简财经
2026-09-04 12:09:36
无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

梦史
2026-08-29 06:21:20
老人因“鱼头对自己”怒斥小辈,被怼到哑口无言:没生在紫禁城,就别那么多穷规矩!

老人因“鱼头对自己”怒斥小辈,被怼到哑口无言:没生在紫禁城,就别那么多穷规矩!

妍妍教育日记
2026-08-16 10:05:09
全网都在画清华丁教授:用你的画风画你,怎么就成了人身攻击?

全网都在画清华丁教授:用你的画风画你,怎么就成了人身攻击?

再战五百回合
2026-09-01 22:32:53
“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

林林先生
2026-08-27 19:14:35
阿隆索致命失误!切尔西自毁天才!新萨拉赫 + 德布劳内恐将离队

阿隆索致命失误!切尔西自毁天才!新萨拉赫 + 德布劳内恐将离队

澜归序
2026-09-04 09:51:54
账面328亿美元!孙宇晨公开资产估值表引热议,网友:大部分其实都不能变现

账面328亿美元!孙宇晨公开资产估值表引热议,网友:大部分其实都不能变现

火山詩话
2026-09-02 17:12:20
陆毅:我这辈子最正确的决定,就是当年在排练时,故意NG七次也要多抱鲍蕾一次

陆毅:我这辈子最正确的决定,就是当年在排练时,故意NG七次也要多抱鲍蕾一次

飘飘然的娱乐汇
2026-09-03 21:10:06
印度学者曾表示,就国家层面而言,当今世界美国是第一,其次是俄罗斯,第三肯定是印度,第四是中国

印度学者曾表示,就国家层面而言,当今世界美国是第一,其次是俄罗斯,第三肯定是印度,第四是中国

扶苏聊历史
2026-08-27 15:00:02
告别红利!雁塔二手房暴涨万套,西安楼市彻底进入买方寒冬!

告别红利!雁塔二手房暴涨万套,西安楼市彻底进入买方寒冬!

童童聊娱乐啊
2026-09-04 10:30:02
存款大势已定!从2026年9月起,银行储蓄市场这4个信号值得警惕!

存款大势已定!从2026年9月起,银行储蓄市场这4个信号值得警惕!

猫叔东山再起
2026-09-04 09:25:11
越南外交部正式发声,态度强硬。 “未经越方许可、完全非法无效”

越南外交部正式发声,态度强硬。 “未经越方许可、完全非法无效”

王姐懒人家常菜
2026-09-03 06:34:15
新型保姆火了!不住家也不是钟点工,省钱又省心,很多家庭已用上

新型保姆火了!不住家也不是钟点工,省钱又省心,很多家庭已用上

娱乐圈见解说
2026-09-03 00:26:58
幼儿园老师透露:第一天上幼儿园不哭的孩子,多半出自这3种家庭

幼儿园老师透露:第一天上幼儿园不哭的孩子,多半出自这3种家庭

浩源的妈妈
2026-09-02 15:40:12
2026-09-04 13:44:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13915文章数 142729关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

媒体:美国G20相关会议声明单独"点名"中国 十分罕见

头条要闻

媒体:美国G20相关会议声明单独"点名"中国 十分罕见

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

王宝强冯清八年未领证!真相令人泪目

财经要闻

GPT-6 Astra上线,AGI时代真到来了吗?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

家居
教育
手机
亲子
房产

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

校服可以自由买了,为什么家长却更焦虑?真正缺少的不是选择,而是确定感

手机要闻

行业最好的2K屏!iQOO 16首发三星M16发光材料:苹果折叠屏同款方案

亲子要闻

一眨眼七岁了,他昨天还主动跟班主任说4号是他的生日 杨雪呀

房产要闻

交付倒计时!超级地中海·憘悦,给海南顶豪打了个样!

无障碍浏览 进入关怀版