![]()
认知神经科学前沿文献分享
论文信息:Peng Wang、Fred Paas,Five Educational-Psychology Lenses for Training and Evaluating AI Models,Educational Psychology Review,2026。DOI:10.1007/s10648-026-10195-8
引言
假设一名学生在老师提供例题、解题模板和关键提示时,数学考试拿到了满分。
但只要撤掉模板、换一种题目表述,或者把数字和情境稍作修改,他的成绩就迅速下降。
我们还会说他真正掌握了数学推理吗?
今天的大模型,可能正面对同样的评价问题。
模型在Benchmark上不断刷新纪录,发布会上充满“推理能力提升”“对齐能力增强”“接近专家水平”等表述。但一个越来越难以回避的问题是:
高分究竟代表模型获得了稳定能力,还是代表它越来越会做特定形式的考试?
2026年发表于《Educational Psychology Review》的一篇文章,尝试用教育心理学重新审视AI训练与评估。作者王彭和 Fred Paas 提出了五种观察视角:课程设计、教学脚手架、评估效度、社会学习和伦理对齐。
这篇文章提出的是一个更加克制、也更加有意思的观点:
教育心理学积累了大量识别死记硬背、应试训练、教师依赖和评分投机的方法。这些方法,同样可以用来审查大模型的能力声明。
核心理论
分数不是能力本身
教育测量学家 Messick 的有一个著名的效度理论,其观点是:效度不是一张试卷天然具有的属性,而是我们能否根据考试成绩,合理推断被测者具备某种能力,放在大模型上,这意味着:一个模型在数学Benchmark上得了90分,并不自动证明它具备“数学推理能力”。还需要排除至少四种替代解释
1. 支持依赖:只有在特定提示词、思维链或工具存在时才能答对;
2. 代理指标优化:学会了能拿分的表面特征,而不是目标能力;
3. 评分者特异性迎合:学会讨好某类标注者,而非形成稳定行为;
4. 应试与污染:见过测试题、相似题,或专门针对Benchmark进行优化。
所以关键或许不在于模型得了多少分,这个分数究竟允许我们对模型作出什么推断?或许是更值得关注的地方
五个教育心理学“镜头”
教育心理学视角
对应的AI实践
作者要求追问的问题
课程设计
数据筛选、难度排序、任务调度、奖励塑形
换一种任务分布后,能力还能迁移吗?
教学脚手架
Few-shot示例、思维链、提示词、工具调用
撤掉或扰动支持后,表现是否崩溃?
评估与效度
Benchmark、排行榜、奖励模型
测到的是能力,还是刷题技巧?
社会学习
模仿学习、RLHF、RLAIF
模型学到了原则,还是迎合某类老师?
伦理对齐
安全训练、拒答规则、宪法式原则
行为是否能跨语言、角色和情境保持稳定?
第一副镜头:训练数据也是一份“课程表”
课程学习并不是新概念。机器学习中早已存在从简单样本到复杂样本、困难样本挖掘、任务分阶段训练以及自适应课程等方法。
文章的新意不在于再次告诉我们“数据顺序很重要”,而是要求开发者证明:
更快收敛是否带来了更好的迁移?
训练中定义的“困难样本”,真的代表概念难度吗?
课程是否缩窄了模型接触的数据分布?
换一种表达、领域或任务后,提升是否仍然存在?
文章认为,所谓“提示词工程”,从教育学角度看更接近教学脚手架设计。
Few-shot示例类似教师提供例题;思维链提示类似要求学生写出解题步骤;检索、计算器和外部工具则提供额外支持。
但脚手架的核心不只是“加上以后成绩提高”,而是要进行渐隐测试:
不再要求逐步思考,准确率还剩多少?
换一种提示模板,效果是否消失?
删除示例或更改示例顺序,模型是否崩溃?
在结构相同、表面不同的问题上,方法能否迁移?
如果一撤掉“让我们一步一步思考”,模型就不会推理,那么更谨慎的结论应当是:这个模型在特定外部结构支持下表现较好。
第三副镜头:Benchmark也会诱发“应试教育”
当一个指标开始决定资源、声誉和模型排名时,它就不再只是测量工具,也会反过来改变训练行为。
开发者会围绕它选数据、调参数、设计提示和修补错误。最终出现的提升,可能来自:
训练集和测试集污染;
对题型和表达格式的熟悉;
利用标注瑕疵和风格线索;
针对排行榜进行专项训练;
通过奖励模型的漏洞获得高分。
这和学校中的“教学围着考试转”非常相似:学生分数提高了,但考试与真实能力之间的关系反而变弱。
第四副镜头:RLHF里的“老师”是谁
通过人类反馈进行强化学习,本质上会让模型更倾向于产生标注者喜欢的回答。
问题在于,“人类偏好”从来不是一个天然统一的变量。它取决于:
标注者来自什么文化和职业背景;
标注规范如何书写;
标注者是否一致;
什么风格更容易被判为“高质量”;
少数群体的偏好是否被平均值淹没。
模型可能没有学会一个普遍原则,只是学会了某一批评分者喜欢的语言风格。
因此文章提出,不应只报告一个平均偏好分数,还应报告评分者间一致性、不同评分者群体的影响,以及模型在不同语言、角色设定和社会情境中的稳定性。
文章还进一步指出,用另一个AI生成训练数据时,那个AI同样是“老师”。它自身的偏见、行为倾向和隐含规则,可能作为“隐藏课程”传递给下一代模型。
第五副镜头:安全拒答不等于道德理解
模型在常见危险提示下稳定拒答,只能证明它在这些条件下表现出了可靠行为。
这不等于它:
理解了伤害为什么错误;
形成了稳定价值观;
具备人类意义上的道德判断;
在所有新情境中都会坚持相同原则。
作者建议用新的价值冲突、提示改写、角色切换、多语言输入和对抗性包装来测试对齐。如果模型换个角色、换种语言或换个叙事框架就改变立场,那么所谓对齐可能只是模板化服从。
五点建议
作者最终把框架压缩为五件事:
- 记录训练课程
:公开不同阶段的数据来源、顺序和难度特征;
- 开展脚手架撤除实验
:报告有提示和无提示、使用工具和不使用工具时的差异;
- 把Benchmark当成高风险测量工具
:提前识别捷径,并设定更新与退役机制;
- 审计教师信号
:记录人类标注者和AI教师的构成、规范、一致性与来源;
- 区分行为与理解
:可靠拒答可以称为可靠行为,不应直接写成“内化了价值观”。
这五条其实构成了一份很实用的模型评测审查表
核心结论
文章把大模型开发重新描述为一套类似教育过程的系统:
训练数据及其顺序,相当于课程设计;
提示词、示例、思维链和工具,相当于教学脚手架;
人类反馈和AI反馈,相当于教师评价与社会化;
Benchmark相当于考试;
对齐训练相当于某种功能意义上的规范教育
作者认为,现有大模型取得更高分,并不等于它获得了更强的能力。它可能只是更依赖提示、更擅长迎合评分者,或者更会钻评测规则的空子
分享人:王彭,天天
审核:PsyBrain 脑心前沿编辑部
你好,这里是「PsyBrain 脑心前沿」
专注追踪全球认知神经科学的最尖端突破
视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊
每日速递「深度解读」与「前沿快讯」
科研是一场探索未知的长跑,但你无需独行。欢迎加入PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。
点击卡片进群,欢迎你的到来
一键关注,点亮星标 ⭐ 前沿不走丢!
![]()
一键分享,让更多人了解前沿
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.