网易首页 > 网易号 > 正文 申请入驻

微软×UIUC:给每个学生造一个「数字分身」,AI教师终于有了陪练

0
分享至



User simulator 正在进入 AI agent 训练流程。客服、电商、医疗问诊、网页操作等场景里,研究者会构造模拟用户,让 agent 在上线前经历更多交互,测试策略、话术和鲁棒性。

教育场景也需要这样的模拟用户,只是这里的「用户」,也就是「学生」,更难模拟:一个学生有相对稳定的知识边界、错误习惯和学习轨迹;学生模拟强调的是学生认知动态的保真,同一句指导,可能让一个学生改正错误,也可能让另一个学生只学会套答案。

这也是学生数字孪生受到关注的原因。AI 教师要学习个性化指导,需要看到学生对教学内容、教学策略的反应。真实学生反馈可以提供这些信号,而获取往往要通过学生参与人类测试,成本很高。

直接让大模型扮演学生,看起来是省事的方案。如果告诉它「你是一个基础薄弱的小学生」,模型可以立刻换成小学生口吻,也能表现出犹豫和不确定。

但角色语气和认知水平不是一回事。一个模型可以用低龄学生的语气回答「我不太懂」,下一句却给出微积分级别的推理。它看起来在扮演学生,实际反馈仍然受模型自身知识储备影响。

用于 AI 教师训练时,这种偏差会带来问题。AI 教师得到的不是某个学生在当前能力边界下的反应,而是一个高能力模型经过人设包装后的反应。

微软和 UIUC 近期的合作研究 StudentSim,正是从这个问题出发。教育学里评价一次指导是否有效,不仅只看学生独立作答时的表现,也要看学生在接受帮助后能走多远。Vygotsky 提出的「最近发展区」讨论的就是这件事:学生当前能独立完成什么,和在教师支持下能够完成什么,中间的差距反映了教学可以介入的空间。

放到学生模拟器上,这个思想对应两类能力。第一,模拟器要能复现学生独立作答时的状态,包括能力边界、错误习惯和常见选择。第二,模拟器要能在读到教师指导后产生相应变化,表现出这个学生在帮助下可能出现的认知状态的更新。

StudentSim 把这两类能力分别定义为 behavioral fidelity 和 guidance responsiveness,并用真实学生记录训练个性化学生模拟器。这样得到的 AI 学生,不只输出一个「像学生」的回答,还要能对教学指导作出可测的响应。



  • 论文标题:StudentSim: Training LLM-based Student Simulators
  • 论文链接:https://arxiv.org/abs/2609.01591
  • 项目代码:https://github.com/microsoft/StudentSim
  • 项目主页:https://microsoft.github.io/StudentSim/
  • Hugging Face Paper 主页:https://huggingface.co/papers/2609.01591

AI 教师正在变得越来越会讲题。但一个更难的问题是:它怎么知道自己讲得有没有用?

在真实课堂里,教师不能只输出答案。学生听完之后会不会改正错误,会不会暴露新的误区,会不会因为提示太直接而跳过思考,才是教学是否有效的关键信号。对于 AI 教师来说,这个反馈尤其昂贵。每改一次教学策略,都需要真实学生参与、等待他们完成学习,再用 human study 验证效果。这个过程往往以周为单位,远慢于今天大模型和 AI 教师的迭代速度。



这正是 StudentSim 想解决的问题:它是一个基于真实学生数据训练的个性化学生模拟器框架,目标是为每个学生训练一个对应的模拟器,让它既能复现该学生的错误和能力边界,又能在读到教师指导后产生合理更新。

研究团队同时提出 StudentSimEval,用统一协议评估学生模拟器的两个核心能力:behavioral fidelity 和 guidance responsiveness。前者衡量模拟器是否像目标学生,后者衡量它是否能在教师指导后向正确方向更新。

这两个指标对应了 AI 教师训练中最需要的两类信号:一个个性化起点,以及一个可被教学干预影响的学习动态。

为什么 prompt 一个 LLM 还不够?

过去的学生建模方法大致分成两类。

一类是知识追踪和行为预测模型。它们基于真实学习轨迹,通常后验记录学生状态。但这类方法缺少自然语言指导输入通道。换句话说,它们能比较精确地追踪学生过去怎么做,却很难回答「如果老师这样讲,学生会不会改」。

另一类是 LLM 角色扮演。给大模型一段充足的学生画像,让它扮演某个水平的学生,再让它读教师解释并给出反应。这类方法能流畅处理自然语言指导,但问题在于认知水平不保真。一个 LLM 可以用幼儿园语气说话,却仍然带着远超目标学生的知识和推理能力。

StudentSim 试图解决这两大问题:直接从学生数据中训练模拟器。



框架采用两阶段训练。第一阶段,将同一领域内多个学生的记录汇总,训练一个 domain-level base simulator,让模型学习该领域中常见的错误模式、回答格式和指导后的修正路径。第二阶段,再用单个学生自己的少量记录进行 specialization,得到一位学生对应的一支模拟器。

这种设计针对的是真实教育数据中的常见难题:单个学生的数据通常很稀疏,但同一领域里不同学生之间又共享大量结构性规律。StudentSim 先学习群体先验,再学习个体差异。

三个领域,60 个学生

为了避免只在单一任务上验证,研究团队构建了 StudentSimEval,覆盖国际象棋、第二语言英语写作和基础数学三个领域,共 60 名学生。

在国际象棋中,模拟器需要预测某个玩家在棋盘位置上的下一步走法,并在读到自然语言教练指导后更新走法。在二语写作中,模拟器需要生成符合特定学习者错误分布的英文作文,并根据教师修改建议改写片段。在数学中,模拟器需要预测学生会给出哪个解,并在读到教师指导后改正。

所有方法都在相同的 per-student training records 上拟合,并在相同 held-out records 上评估。

结果显示,StudentSim 在三个领域的 fidelity 和 responsiveness 上均超过最强可用基线。



例如,在国际象棋任务中,StudentSim 的 behavioral fidelity 达到 0.5150,高于 Maia2 的 0.4535,也明显高于 GPT-5.4 的 0.2316;guidance responsiveness 达到 0.9067,高于 GPT-5.4 的 0.7186 和 Maia2 的 0.2721。

这个结果也呈现出两类基线的典型短板。Maia2 能较好预测人类棋手的 move distribution,但没有自然语言指导输入通道,因此 responsiveness 较低。GPT-5.4 能读懂指导并做出响应,但无法稳定复现具体学生的能力、习惯和错误,因此 fidelity 较低。StudentSim 则同时提升了两项指标。

从学生模拟器到 AI 教师强化学习

论文还进一步验证了 StudentSim 能否作为 AI 教师训练中的反馈信号。



研究团队在国际象棋教学场景中构建了一个训练教师模型的 RL proof of concept。训练过程中,AI 教师根据真实学生记录中的错误走法生成指导;冻结的学生模拟器读到指导后输出修正走法;奖励函数根据修正走法相对原错误走法的 Stockfish 质量提升来更新教师模型。

对照组包括不做 RL 的 SFT 教师模型,以及使用 GPT-5.4 作为学生模拟器 reward 的 RL 教师模型。三组共享同一个 tutor policy、同一个 SFT 起点和相同 GRPO 设置,区别只在 reward 来源。

最终由 8 名国际象棋评估者进行盲评。StudentSim reward 训练出的 AI 教师在三项指标上均最高:accuracy 90.5%,guidance quality 3.31,personalization 3.93。相比之下,No RL 的 accuracy 为 75.7%,GPT-5.4 reward 为 71.6%。

研究团队强调,这并非是「最强 AI 教师」的声明,而是为了验证一个更基础的问题:一个同时具备 fidelity 和 responsiveness 的学生模拟器,是否能为 AI 教师优化提供有用的代理反馈。结果表明,StudentSim 作为 reward 来源,比单纯 prompt frontier LLM 更有效,也更适合本地部署和定制。

对 AI 教育系统来说,这意味着一个新的训练闭环:真实学生数据不只用于评估 AI 教师,也可以用于训练可复用的学生模拟器;这些模拟器再为 AI 教师的策略优化提供高通量反馈。

作者简介

杨可,UIUC 计算机第四年在读博士,导师为翟成祥教授,本科毕业于清华大学。研究方向为 AI agents、语言模型、信息检索与多模态基础模型,同时关注 AI 系统中的偏见与歧视问题。曾在 Amazon AWS、Microsoft Research Deep Learning Group、Google 实习。个人主页:https://empathyang.github.io

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
iPhone 18 Pro Max开始预热,但价格和配色却对不上

iPhone 18 Pro Max开始预热,但价格和配色却对不上

搞机小帝
2026-09-08 23:58:03
北京超20年吉野家老店将关闭?有网友称“不如以前了”!多地还在开新店…

北京超20年吉野家老店将关闭?有网友称“不如以前了”!多地还在开新店…

北京商报
2026-09-08 22:32:57
28岁外卖员感染艾滋病,医生寻找原因,流泪坦言:当时没注意

28岁外卖员感染艾滋病,医生寻找原因,流泪坦言:当时没注意

路医生健康科普
2026-09-05 13:24:57
凌晨0点45 巴萨亮相欧冠:冲击开门红!旧将反戈 首发曝光

凌晨0点45 巴萨亮相欧冠:冲击开门红!旧将反戈 首发曝光

叶青足球世界
2026-09-09 05:00:03
小米再次背水一战

小米再次背水一战

全天候科技
2026-09-08 00:47:41
上海这里,征收范围定了!

上海这里,征收范围定了!

新浪财经
2026-09-08 18:44:16
女子需求大约男网友开房,缠绵后被男网友抛尸,2015年丈夫得知妻子被杀很痛心

女子需求大约男网友开房,缠绵后被男网友抛尸,2015年丈夫得知妻子被杀很痛心

汉史趣闻
2026-09-07 09:30:22
乌克兰记者三问美特使:跟普京坐一桌,你不恶心吗?

乌克兰记者三问美特使:跟普京坐一桌,你不恶心吗?

浯江孤舟
2026-09-07 20:53:36
17个月后欧盟大门或关闭,996就是强迫劳动,9成中小企业却还没醒

17个月后欧盟大门或关闭,996就是强迫劳动,9成中小企业却还没醒

浯江孤舟
2026-08-10 10:00:15
英伟达RTX 5090公版回归原价,显卡市场要变天?

英伟达RTX 5090公版回归原价,显卡市场要变天?

小柱解说游戏
2026-09-09 05:34:06
彭清华出席朝鲜驻华使馆国庆78周年招待会

彭清华出席朝鲜驻华使馆国庆78周年招待会

新华社
2026-09-08 22:28:02
女篮世界杯激烈一夜:韩国惨败出局,日本输21分遭淘汰,8强已定6席!

女篮世界杯激烈一夜:韩国惨败出局,日本输21分遭淘汰,8强已定6席!

一溪风月w
2026-09-09 04:50:36
凡人微光|这些年轻人,活成了自己想要的样子

凡人微光|这些年轻人,活成了自己想要的样子

新华社
2026-09-07 18:08:12
研究发现:常晚上刷牙的人,患高血压、脑梗风险会比其他人低!

研究发现:常晚上刷牙的人,患高血压、脑梗风险会比其他人低!

路医生健康科普
2026-09-08 20:25:03
一个被很多人忽略的史诗时刻:特斯拉可能正在把电池工艺推向爆发

一个被很多人忽略的史诗时刻:特斯拉可能正在把电池工艺推向爆发

旧史新谭
2026-09-07 18:40:37
好家伙!《早春晴朗》24集大结局太狠了,栾念见狗不见人、孙远翥26岁跳云海,是我今年看过最震撼的结局

好家伙!《早春晴朗》24集大结局太狠了,栾念见狗不见人、孙远翥26岁跳云海,是我今年看过最震撼的结局

陈意小可爱
2026-09-09 04:01:38
欧盟印度伊朗日本都栽了:低估美国,更严重错估了中国

欧盟印度伊朗日本都栽了:低估美国,更严重错估了中国

健身狂人
2026-09-08 07:38:09
美印太司令与中方当面谈妥一件事,两架美制F-16送台半路突然掉头

美印太司令与中方当面谈妥一件事,两架美制F-16送台半路突然掉头

薛小荣
2026-09-08 13:11:56
美股三大指数集体收跌,AI算力租赁商、光通信板块大涨

美股三大指数集体收跌,AI算力租赁商、光通信板块大涨

每日经济新闻
2026-09-09 05:08:16
牡丹花下死?汪峰将森林北踢出局,这次终于彻底印证葛荟婕的评价

牡丹花下死?汪峰将森林北踢出局,这次终于彻底印证葛荟婕的评价

历史的烟火
2026-08-14 15:48:04
2026-09-09 07:16:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13948文章数 142730关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

太子奶创始人李途纯北京离世 曾被羁押身陷囹圄15个月

头条要闻

太子奶创始人李途纯北京离世 曾被羁押身陷囹圄15个月

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

手机
家居
健康
教育
军事航空

手机要闻

华为Mate XT 2被拆:麒麟9050 Pro的丝印和架构细节,被逐一确认!

家居要闻

2026建博会(广州) 公装联探展交流活动

同样是脑梗,为何康复结局大不同?

教育要闻

问题一大堆的学生,你用我的思路试一试,很多老师都受益了

军事要闻

胡塞武装用自行生产的导弹袭击沙特军车

无障碍浏览 进入关怀版