AI教学的正确方式

2026-09-11 04:25:10 · chineseheadlinenews.com · 来源: 新智元

AI教师已经可以完成不少单次教学任务。

一道数学题,它能拆解步骤;一篇英文作文,它能指出语法问题;一盘棋,它也能讲出下一步思路。很多场景里,模型输出已经足够像一位耐心助教。

但教学效果不能只看教师端。学生听完之后有没有改正错误,是否只是照着提示走,同一句讲解对不同学生是否产生不同效果,这些都发生在学生端。

AI教师如果要学习个性化指导,也需要反复观察学生反应。

现实里,这些反应主要来自human study。每次调整教学策略,都要组织学生参与,收集交互,再由人工评估。

AI模型可以快速更新,但教育反馈的获取速度受human study实验周期限制。

AI tutor需要学生反馈来改进教学,但真实反馈采集成本较高。StudentSim希望把真实学生记录转化为训练阶段可反复调用的代理反馈。

近期研究StudentSim,从这个矛盾出发。

研究团队希望提升AI教师,使其理解学生优劣势,并根据不同学生给出合适指导。推进过程中,团队把问题落到学生模拟器上:能否用真实学生数据训练出可评估、可复用的AI学生,让AI教师在训练阶段获得更多反馈。

论文链接: https://arxiv.org/abs/2609.01591

代码链接:https://github.com/microsoft/StudentSim

Huggingface Paper主页:https://huggingface.co/papers/2609.01591

这件事放在今天的AI agent研究里并不孤立。User simulator正在成为热门的研究方向,进入客服、电商、医疗问诊、网页操作等场景。研究者会构造模拟用户,让agent在上线前经历更多交互,测试策略、话术和鲁棒性。

教育场景里的用户模拟更复杂。学生有相对稳定的知识边界、错误习惯和学习轨迹。同一道题,有人会算错符号,有人会误解概念,有人听完提示后可以自己推到答案,有人需要更直接的指导。

近来被讨论的人类学生数字孪生,也正是围绕这类需求展开。

建模学生并不是新题目

从1995年的贝叶斯知识追踪,到深度知识追踪、再到注意力知识追踪,这条方向已经被前人探索了近30年,在拟合学生行为上相当成熟。

它们的共同缺口在于,模型只接受题目、状态、能力值这类结构化输入,没有一个接收自然语言指导的入口。无论教师说了什么,这类模型无法交互作出像学生一样的表现改变。

如果直接让大模型扮演学生,看起来很方便。给它写一句“你是一个数学基础薄弱的小学生”,模型可以立刻换成低龄学生口吻,也能表现出犹豫和不确定。

可是,角色语气和认知水平并不同步。

一个模型可以用小学生口吻回答“我不太懂”,下一句却给出微积分级别的推理。它看起来在扮演学生,实际反馈仍然受模型自身知识储备影响,可能远远高于它被限制拥有的知识水平。

用于AI教师训练时,这种认知水平偏差会带来问题。Tutor得到的不是某个学生在当前能力边界下的反应,而是一个高能力模型经过人设包装后的反应。

也正是因为这样,仅靠一段能力描述做条件,对大模型来说,是一条很脆弱的条件通道。这条路线近两年被大量套用到教育场景,对话辅导语料、多智能体课堂、学习者数据生成都在用;与此同时,一批专门检验其效度的研究也在出现,从架构、保真度基准、教师使用体验三个角度提出质疑。

教育学中,评价一次指导是否有效,通常不能只看学生独立作答时的表现,也要看学生在接受帮助后能走多远。

Vygotsky提出的最近发展区(zone of proximal development)讨论的就是这件事:学生当前能独立完成什么,和在教师支持下能够完成什么,中间的差距反映了教学可以介入的空间。

这一想法后来被动态评估(dynamic assessment)落为可操作的测量程序:不只记录学生答对与否,还要在给出提示后观察他的表现如何移动。

放到学生模拟器上,这个思想对应两类能力。

第一,模拟器要能复现学生独立作答时的状态,包括能力边界、错误习惯和常见选择。第二,模拟器要能在读到教师指导后产生相应变化,表现出这个学生在帮助下可能出现的更新。

StudentSim

StudentSim把这两类能力分别定义为behavioral fidelity和guidance responsiveness,并据此训练和评估个性化学生模拟器。

学生模拟器需要同时回答两个问题:独立作答时是否像目标学生,接受教师指导后是否产生相应变化。

训练流程分为两步。

第一步汇总一个领域内多名学生记录,训练通用学生行为模型。这个阶段学习共性错误、回答格式、指导后的修正路径。

第二步使用单个学生自己的记录继续训练,得到个性化模拟器。单名学生记录少,直接训练容易过拟合;先学习群体规律,再适配个人数据,可以更稳定地获得每位学生对应的模拟器。

训练流程

研究团队同时构建StudentSimEval。评估覆盖60位真实学生,来自国际象棋、第二语言英语写作和基础数学三个场景。

国际象棋中,模拟器要预测某位玩家在棋局中的走法,并在教练指导后改走位。二语写作中,模拟器要生成符合学习者错误模式的作文,并根据教师批改改写片段。数学中,模拟器要预测学生答案,并在讲解后修正。

这些任务表面差异很大,评估目标保持一致:先看模拟器是否像学生本人,再看它能否响应指导。所有方法拿到同一份学生记录,在相同held-out测试记录上比较。

国际象棋结果中,StudentSim的F为0.5150,R为0.9067;GPT-5.4分别为0.2316和0.7186;Maia2分别为0.4535和0.2721。二语写作和数学实验中,StudentSim也在两个指标上超过对应基线。

国际象棋评测中的二维结果。GPT-5.4响应指导较好,但行为保真较低;Maia2更贴近棋手走法,但缺少自然语言指导入口;StudentSim位于两项指标同时较高的位置。

这组结果呈现出清晰分工。GPT-5.4能阅读指导,模拟具体学生时保真不足。Maia2更贴近人类棋手走法,无法吸收自然语言教练提示。StudentSim通过真实学习记录训练,并对每位学生进行适配,在个体行为和指导响应两方面同时获得提升。

不过学生模拟器本身不是目的,终点是,它的功用需要能落地到现实世界,能被用来改进教师模型。

以往训练AI tutor,奖励信号在一些工作中来自专家标注的优质辅导对话,另外一些来自使用评分量表的通用大模型裁判。也有工作尝试把奖励接到模拟学生上,但采用的都是认知水平并不保真的角色扮演的LLM学生,而不是在真实学习者数据上训练过的模拟器。StudentSim在这一点上提出了不同的做法。

论文进一步把StudentSim放入AI tutor强化学习流程。

实验场景为国际象棋。系统先取出真实学生犯过的错误走法,AI tutor生成指导,StudentSim读完指导后给出修正走法。

Stockfish用于计算修正走法相对原错误走法的质量变化,这个分数回传给tutor作为RL信号。对照组包括无RL的tutor,以及使用GPT-5.4作为学生模拟器reward的tutor。

Tutor生成指导,冻结的AI学生模拟器给出修正答案,系统根据修正前后的质量变化更新tutor。

三组tutor使用相同基础模型、SFT起点和GRPO设置,reward来源不同。

国际象棋评估者进行盲评后,StudentSim reward训练出的tutor在准确性、指导质量和个性化评分上均排在第一。

专家在打乱呈现顺序的条件下盲评三个维度:准确性看“没有误导性事实错误”的回答占比,指导质量和个性化各为1到5分。StudentSim reward训练出的tutor在三个维度上均排第一。

更值得注意的是结果反向的一组实验:用GPT-5.4当学生模拟器训出来的tutor,准确性不仅输给StudentSim,还低于完全没做RL的基线,拖后腿的是明显更高的严重事实错误率。模拟器不保真,会把教师往错的方向推:一个认知水平不符合真实学生、但理解能力超强的模拟器,读完再离谱的指导也能自己推出某种答案,于是给错误指导发了随机奖励,RL就朝着混乱(甚至错误)的方向优化。

StudentSim没有把真实学生实验从教育研究中取代。它把真实学生记录转化成训练阶段可反复调用的模拟反馈,使AI tutor在进入human study前完成更多轮筛选和优化。

对于需要个性化反馈的AI教师系统,这类学生模拟器、延续着近期热门的用户模拟器的思想脉络(一切人都可以模拟,建造人类的数字孪生),提供了一条颠覆性的工程路径:

学习学生如何出错,学习学生如何在指导下改变,为教师模型的强化学习提供机器学习时间尺度的反馈信号。


    24小时新闻排行榜更多>>
  1. 泰国名寺住持侵吞9200万泰铢被捕
  2. 为会晤铺路 习近平访美前 中国采购百万吨美国大豆
  3. 夜店撒钱 豪车成排 林誉轩认罪:$2.45亿比特币是偷的
  4. 习近平接班人会是谁?日经关注上海这位70后
  5. 最新爆料:青岛造船厂起火外籍货轮涉“影子船”
  6. 华人女子希腊失踪 护照被撕成22块碎片 附近有骸鼻
  7. 周恩来也有不必忍的时候 周差点枪毙了毛泽东
  8. 末日论者曝惊人AI实验
  9. 中国制坦克突膛炸 孟加拉演习2死1重伤 士兵喷飞画面曝
  10. 这个国家,快把兄弟们得罪光了
  11. 如何真正提高投资的回报?
  12. 美债抛售叠加供给潮施压
  13. 德国收紧对华签证审批 提到航天、5G就危险了?
  14. 丝绒长裙+大背头,高圆圆惊艳全场
  15. 大西洋月刊爆料:美专家和台退役军官差点打起来
  16. 中美正就300亿美元对等降税框架安排进行磋商
  17. 中国游客掐颈天鹅摆拍
  18. 青岛造船厂外籍货轮起火增至25死 习近平下指示
  19. 中国手机开屏广告害死人 “魔法画报”耽误急救老人离世
  20. 灵活就业人员医保新政来了,政策真的有用吗?
  21. 中国《国防动员法》升级 为可能的武统量身定制?
  22. 伊朗镐山存在施工活动
  23. 为什么现代人越来越离不开零食?其危害是什么
  24. 毛泽东去世50周年 大学生受访落泪 评论区讽刺一片
  25. 梅姨首任丈夫:知道她心狠人懒,但不知这么坏
  26. OpenAI首席科学家:异类心智正在诞生 恐脱离掌控
  27. 25周年纪念日:“9·11”事件时间线
  28. 刘翔的微博和上海体育局的“情况说明”
  29. 阿尔卑斯山重大事故!旅行团翻车 48乘客多人死伤
  30. 刘翔“切割”不到24小时,十年无子隐情曝光
  31. 美住房部长企图拍打女议员臀部,被全程直播
  32. “身带弓”魔咒 中南海谶纬大清洗深度推演
  33. 京东收购德国电子零售巨头遇阻
  34. 9·11恐袭25年后,纽约的“归零”与重生
  35. 刘翔安置事件尘埃落定,但他说的第三条路在哪里?
  36. 捐款5年,谁在电话那头笑
  37. 金融圈最炸裂父子当庭翻脸
  38. 中国驻日本大使馆:调整对日签证规费
  39. 西北政法大学发布通告
  40. 信任崩盘,愤怒的日本年轻人对高市早苗“脱粉回踩”
  41. 遭183次水刑、裸体拘押,“9·11”案主犯还没判
  42. 组图:洛杉矶法轮功学员大炼功 迎中秋话感恩
  43. 国家电视台前外籍专家揭露新闻审查机制
  44. 纽约2977架无人机重现世贸双子塔
  45. 逃离病房,一群妈妈的特殊旅行
  46. 挖出104个人头骨,这里到底什么来头?
  47. 法轮大法润泽哥大校园 讲真相一年变化显着
  48. 卢比奥访问秘鲁:强调此事必要性
  49. 教体局回应“60平以下无法入学”
  50. 年轻人最奢侈的下班活动:干针线活
  51. 川普要发钱,引发合法性等疑问
  52. 伊朗如何绕过制裁?路透:用石油跟中国“以物易物”
  53. 中国人居然被台湾“这一个词汇”震撼了!
  54. 美国预告:下周制裁一家大型银行
  55. 浓眉大眼de饶毅论文数据造假:比刘光慧严重
  56. 弯刺蔷薇缘何成为月季的抗寒育种亲本?
  57. 放弃高薪大厂去当老师的人,开始变多了
  58. 油价飙升叠加通胀压力,亚洲股债双杀
  59. 香港投行遭遇现实考验
  60. 这一次,文艺青年最后的体面崩了