网易首页 > 网易号 > 正文 申请入驻

大模型也会刷题、看提示、迎合老师:我们可能一直在错误地评价AI

0
分享至


认知神经科学前沿文献分享

论文信息:Peng Wang、Fred Paas,Five Educational-Psychology Lenses for Training and Evaluating AI Models,Educational Psychology Review,2026。DOI:10.1007/s10648-026-10195-8

引言

假设一名学生在老师提供例题、解题模板和关键提示时,数学考试拿到了满分。

但只要撤掉模板、换一种题目表述,或者把数字和情境稍作修改,他的成绩就迅速下降。

我们还会说他真正掌握了数学推理吗?

今天的大模型,可能正面对同样的评价问题。

模型在Benchmark上不断刷新纪录,发布会上充满“推理能力提升”“对齐能力增强”“接近专家水平”等表述。但一个越来越难以回避的问题是:

高分究竟代表模型获得了稳定能力,还是代表它越来越会做特定形式的考试?

2026年发表于《Educational Psychology Review》的一篇文章,尝试用教育心理学重新审视AI训练与评估。作者王彭和 Fred Paas 提出了五种观察视角:课程设计、教学脚手架、评估效度、社会学习和伦理对齐。

这篇文章提出的是一个更加克制、也更加有意思的观点:

教育心理学积累了大量识别死记硬背、应试训练、教师依赖和评分投机的方法。这些方法,同样可以用来审查大模型的能力声明。

核心理论

分数不是能力本身

教育测量学家 Messick 的有一个著名的效度理论,其观点是:效度不是一张试卷天然具有的属性,而是我们能否根据考试成绩,合理推断被测者具备某种能力,放在大模型上,这意味着:一个模型在数学Benchmark上得了90分,并不自动证明它具备“数学推理能力”。还需要排除至少四种替代解释

1. 支持依赖:只有在特定提示词、思维链或工具存在时才能答对;

2. 代理指标优化:学会了能拿分的表面特征,而不是目标能力;

3. 评分者特异性迎合:学会讨好某类标注者,而非形成稳定行为;

4. 应试与污染:见过测试题、相似题,或专门针对Benchmark进行优化。

所以关键或许不在于模型得了多少分,这个分数究竟允许我们对模型作出什么推断?或许是更值得关注的地方

五个教育心理学“镜头”

教育心理学视角

对应的AI实践

作者要求追问的问题

课程设计

数据筛选、难度排序、任务调度、奖励塑形

换一种任务分布后,能力还能迁移吗?

教学脚手架

Few-shot示例、思维链、提示词、工具调用

撤掉或扰动支持后,表现是否崩溃?

评估与效度

Benchmark、排行榜、奖励模型

测到的是能力,还是刷题技巧?

社会学习

模仿学习、RLHF、RLAIF

模型学到了原则,还是迎合某类老师?

伦理对齐

安全训练、拒答规则、宪法式原则

行为是否能跨语言、角色和情境保持稳定?

第一副镜头:训练数据也是一份“课程表”

课程学习并不是新概念。机器学习中早已存在从简单样本到复杂样本、困难样本挖掘、任务分阶段训练以及自适应课程等方法。

文章的新意不在于再次告诉我们“数据顺序很重要”,而是要求开发者证明:

  • 更快收敛是否带来了更好的迁移?

  • 训练中定义的“困难样本”,真的代表概念难度吗?

  • 课程是否缩窄了模型接触的数据分布?

  • 换一种表达、领域或任务后,提升是否仍然存在?

第二副镜头:提示词可能只是“拐杖”

文章认为,所谓“提示词工程”,从教育学角度看更接近教学脚手架设计。

Few-shot示例类似教师提供例题;思维链提示类似要求学生写出解题步骤;检索、计算器和外部工具则提供额外支持。

但脚手架的核心不只是“加上以后成绩提高”,而是要进行渐隐测试:

  • 不再要求逐步思考,准确率还剩多少?

  • 换一种提示模板,效果是否消失?

  • 删除示例或更改示例顺序,模型是否崩溃?

  • 在结构相同、表面不同的问题上,方法能否迁移?

如果一撤掉“让我们一步一步思考”,模型就不会推理,那么更谨慎的结论应当是:这个模型在特定外部结构支持下表现较好。

第三副镜头:Benchmark也会诱发“应试教育”

当一个指标开始决定资源、声誉和模型排名时,它就不再只是测量工具,也会反过来改变训练行为。

开发者会围绕它选数据、调参数、设计提示和修补错误。最终出现的提升,可能来自:

  • 训练集和测试集污染;

  • 对题型和表达格式的熟悉;

  • 利用标注瑕疵和风格线索;

  • 针对排行榜进行专项训练;

  • 通过奖励模型的漏洞获得高分。

这和学校中的“教学围着考试转”非常相似:学生分数提高了,但考试与真实能力之间的关系反而变弱。

第四副镜头:RLHF里的“老师”是谁

通过人类反馈进行强化学习,本质上会让模型更倾向于产生标注者喜欢的回答。

问题在于,“人类偏好”从来不是一个天然统一的变量。它取决于:

  • 标注者来自什么文化和职业背景;

  • 标注规范如何书写;

  • 标注者是否一致;

  • 什么风格更容易被判为“高质量”;

  • 少数群体的偏好是否被平均值淹没。

模型可能没有学会一个普遍原则,只是学会了某一批评分者喜欢的语言风格。

因此文章提出,不应只报告一个平均偏好分数,还应报告评分者间一致性、不同评分者群体的影响,以及模型在不同语言、角色设定和社会情境中的稳定性。

文章还进一步指出,用另一个AI生成训练数据时,那个AI同样是“老师”。它自身的偏见、行为倾向和隐含规则,可能作为“隐藏课程”传递给下一代模型。

第五副镜头:安全拒答不等于道德理解

模型在常见危险提示下稳定拒答,只能证明它在这些条件下表现出了可靠行为。

这不等于它:

  • 理解了伤害为什么错误;

  • 形成了稳定价值观;

  • 具备人类意义上的道德判断;

  • 在所有新情境中都会坚持相同原则。

作者建议用新的价值冲突、提示改写、角色切换、多语言输入和对抗性包装来测试对齐。如果模型换个角色、换种语言或换个叙事框架就改变立场,那么所谓对齐可能只是模板化服从。

五点建议

作者最终把框架压缩为五件事:

  1. 记录训练课程

    :公开不同阶段的数据来源、顺序和难度特征;

  2. 开展脚手架撤除实验

    :报告有提示和无提示、使用工具和不使用工具时的差异;

  3. 把Benchmark当成高风险测量工具

    :提前识别捷径,并设定更新与退役机制;

  4. 审计教师信号

    :记录人类标注者和AI教师的构成、规范、一致性与来源;

  5. 区分行为与理解

    :可靠拒答可以称为可靠行为,不应直接写成“内化了价值观”。

这五条其实构成了一份很实用的模型评测审查表

核心结论

文章把大模型开发重新描述为一套类似教育过程的系统:

  • 训练数据及其顺序,相当于课程设计;

  • 提示词、示例、思维链和工具,相当于教学脚手架;

  • 人类反馈和AI反馈,相当于教师评价与社会化;

  • Benchmark相当于考试;

  • 对齐训练相当于某种功能意义上的规范教育

作者认为,现有大模型取得更高分,并不等于它获得了更强的能力。它可能只是更依赖提示、更擅长迎合评分者,或者更会钻评测规则的空子

分享人:王彭,天天

审核:PsyBrain 脑心前沿编辑部

你好,这里是「PsyBrain 脑心前沿」

专注追踪全球认知神经科学的最尖端突破

视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

每日速递「深度解读」与「前沿快讯」

科研是一场探索未知的长跑,但你无需独行。欢迎加入PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

点击卡片进群,欢迎你的到来

一键关注,点亮星标 ⭐ 前沿不走丢!


一键分享,让更多人了解前沿

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
桂林文旅局:关注到桂林文促会发布未经全面核实公告,已启动调查程序

桂林文旅局:关注到桂林文促会发布未经全面核实公告,已启动调查程序

界面新闻
2026-10-02 09:12:31
房价:大家无需等待了,要是不出意外,房价或将会“重演历史”?

房价:大家无需等待了,要是不出意外,房价或将会“重演历史”?

云居历史
2026-10-02 03:07:49
日企巨头被曝把2.31亿颗中国钢球换上自家包装,43家客户无一察觉,它竟称:安全没影响

日企巨头被曝把2.31亿颗中国钢球换上自家包装,43家客户无一察觉,它竟称:安全没影响

天梦见证
2026-10-01 20:52:32
你做过最龌龊,最下流的事是什么?

你做过最龌龊,最下流的事是什么?

那年秋天
2026-08-16 11:50:09
张继科训练基地学费曝光:月收费980元到4400元,学员水平越高收费越低;学员:这个资源收这个费用算很低了,“张继科亲自下场指导训练”

张继科训练基地学费曝光:月收费980元到4400元,学员水平越高收费越低;学员:这个资源收这个费用算很低了,“张继科亲自下场指导训练”

极目新闻
2026-10-01 21:40:09
国家队生涯结束?41岁C罗宣布离开葡萄牙队集训营:会适时公布真相

国家队生涯结束?41岁C罗宣布离开葡萄牙队集训营:会适时公布真相

我爱英超
2026-10-01 06:43:10
江苏富豪重金为痴傻儿子娶妻,拜金女孩欣然答应,新婚当晚却愣住

江苏富豪重金为痴傻儿子娶妻,拜金女孩欣然答应,新婚当晚却愣住

温情邮局
2025-07-09 14:39:26
美媒爆料:美国将向中东增派第三艘航母和多达1万名兵力

美媒爆料:美国将向中东增派第三艘航母和多达1万名兵力

环球网资讯
2026-10-02 08:58:15
他是北京市委原书记,培养了两位正国级领导,离休后定下3条规矩

他是北京市委原书记,培养了两位正国级领导,离休后定下3条规矩

燕小姐说历史
2024-12-08 09:19:59
国庆首日,高速上成了电车续航坟场!油车会淘汰的说法不攻自破

国庆首日,高速上成了电车续航坟场!油车会淘汰的说法不攻自破

刘哥谈体育
2026-10-02 01:10:58
前跳水名将写小说曝光队内霸凌:被扇巴掌被栽赃 只有张家齐不欺负我

前跳水名将写小说曝光队内霸凌:被扇巴掌被栽赃 只有张家齐不欺负我

念洲
2026-10-02 07:59:44
葡媒:葡萄牙总理致电葡足协主席,点名要求与热苏斯通话

葡媒:葡萄牙总理致电葡足协主席,点名要求与热苏斯通话

懂球帝
2026-10-01 18:28:15
真不愧是“化痰冠军”,才喝2回,痰根拔掉,润喉又顺畅

真不愧是“化痰冠军”,才喝2回,痰根拔掉,润喉又顺畅

王二哥老搞笑
2026-10-01 20:43:05
小众变态,印尼9-2孟加拉,与马来西亚同分同净胜球依靠进球晋级

小众变态,印尼9-2孟加拉,与马来西亚同分同净胜球依靠进球晋级

懂球帝
2026-10-02 00:21:38
扎心!6条人命!10月1日沪昆高速货车疲劳肇事:交强险仅20万分摊,商业险或拒赔,上千万赔偿找谁要?

扎心!6条人命!10月1日沪昆高速货车疲劳肇事:交强险仅20万分摊,商业险或拒赔,上千万赔偿找谁要?

火山詩话
2026-10-02 05:42:09
生娃不用自己掏钱了,会有更多人敢生吗?

生娃不用自己掏钱了,会有更多人敢生吗?

育娲人口智库
2026-09-30 17:23:01
刚刚,GPT-6 Astra破解拿破仑百年悬案!217年密信曝光,信息量太大了

刚刚,GPT-6 Astra破解拿破仑百年悬案!217年密信曝光,信息量太大了

新智元
2026-10-01 18:16:34
诺贝尔和平奖揭晓倒计时一周,特朗普再获提名

诺贝尔和平奖揭晓倒计时一周,特朗普再获提名

澎湃新闻
2026-10-01 17:50:27
胡锡进发微博忘删AI回复“需要我帮你通读核对吗?”,网友:比自己写便宜

胡锡进发微博忘删AI回复“需要我帮你通读核对吗?”,网友:比自己写便宜

可达鸭面面观
2026-10-01 14:43:37
广东一建筑工地密密麻麻挂了上百个摄像头,建设方:甲方是造摄像头的

广东一建筑工地密密麻麻挂了上百个摄像头,建设方:甲方是造摄像头的

林子说事
2026-10-02 00:28:34
2026-10-02 09:44:49
PsyBrain脑心前沿
PsyBrain脑心前沿
追踪脑科学新动态,聚焦认知与神经新研究
685文章数 23关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

迪拜航空安全事件疑点重重 副驾驶用何物刺伤机长未知

头条要闻

迪拜航空安全事件疑点重重 副驾驶用何物刺伤机长未知

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

数码
手机
游戏
本地
公开课

数码要闻

美国得州学区弃用谷歌Chromebook,改用苹果MacBook Neo和iPad

手机要闻

缓解折痕加深:苹果首款折叠iPhone Duo支持更换保护膜

《GTA6》十大新情报汇总 天气载具多结局等

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版