🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / AI 与脑科学:顶刊文献解读专题 / A · 文献解读 / A003 · 大模型也会刷题、看提示、迎合老师:我们可能一直在错误地评

A003 大模型也会刷题、看提示、迎合老师:我们可能一直在错误地评价AI

来源:公众号 PSY-Brain_Frontier | 发布:2026-07-22 | 原文链接

图1

认知神经科学前沿文献分享

论文信息:Peng Wang、Fred Paas,Five Educational-Psychology Lenses for Training and Evaluating AI Models,Educational Psychology Review,2026。DOI:10.1007/s10648-026-10195-8

引言

假设一名学生在老师提供例题、解题模板和关键提示时,数学考试拿到了满分。

但只要撤掉模板、换一种题目表述,或者把数字和情境稍作修改,他的成绩就迅速下降。

我们还会说他真正掌握了数学推理吗?

今天的大模型,可能正面对同样的评价问题。

模型在Benchmark上不断刷新纪录,发布会上充满“推理能力提升”“对齐能力增强”“接近专家水平”等表述。但一个越来越难以回避的问题是:

高分究竟代表模型获得了稳定能力,还是代表它越来越会做特定形式的考试?

2026年发表于《Educational Psychology Review》的一篇文章,尝试用教育心理学重新审视AI训练与评估。作者 王彭 和 Fred Paas 提出了五种观察视角:课程设计、教学脚手架、评估效度、社会学习和伦理对齐。

这篇文章提出的是一个更加克制、也更加有意思的观点:

教育心理学积累了大量识别死记硬背、应试训练、教师依赖和评分投机的方法。这些方法,同样可以用来审查大模型的能力声明。

核心理论

分数不是能力本身

教育测量学家 Messick 的有一个著名的效度理论,其观点是:效度不是一张试卷天然具有的属性,而是我们能否根据考试成绩,合理推断被测者具备某种能力,放在大模型上,这意味着:一个模型在数学Benchmark上得了90分,并不自动证明它具备“数学推理能力”。还需要排除至少四种替代解释

1. 支持依赖:只有在特定提示词、思维链或工具存在时才能答对;

2. 代理指标优化:学会了能拿分的表面特征,而不是目标能力;

3. 评分者特异性迎合:学会讨好某类标注者,而非形成稳定行为;

4. 应试与污染:见过测试题、相似题,或专门针对Benchmark进行优化。

所以关键或许不在于模型得了多少分,这个分数究竟允许我们对模型作出什么推断?或许是更值得关注的地方

五个教育心理学“镜头”

教育心理学视角 对应的AI实践 作者要求追问的问题
课程设计 数据筛选、难度排序、任务调度、奖励塑形 换一种任务分布后,能力还能迁移吗?
教学脚手架 Few-shot示例、思维链、提示词、工具调用 撤掉或扰动支持后,表现是否崩溃?
评估与效度 Benchmark、排行榜、奖励模型 测到的是能力,还是刷题技巧?
社会学习 模仿学习、RLHF、RLAIF 模型学到了原则,还是迎合某类老师?
伦理对齐 安全训练、拒答规则、宪法式原则 行为是否能跨语言、角色和情境保持稳定?

第一副镜头:训练数据也是一份“课程表”

课程学习并不是新概念。机器学习中早已存在从简单样本到复杂样本、困难样本挖掘、任务分阶段训练以及自适应课程等方法。

文章的新意不在于再次告诉我们“数据顺序很重要”,而是要求开发者证明:

第二副镜头:提示词可能只是“拐杖”

文章认为,所谓“提示词工程”,从教育学角度看更接近教学脚手架设计。

Few-shot示例类似教师提供例题;思维链提示类似要求学生写出解题步骤;检索、计算器和外部工具则提供额外支持。

但脚手架的核心不只是“加上以后成绩提高”,而是要进行渐隐测试:

如果一撤掉“让我们一步一步思考”,模型就不会推理,那么更谨慎的结论应当是:这个模型在特定外部结构支持下表现较好。

第三副镜头:Benchmark也会诱发“应试教育”

当一个指标开始决定资源、声誉和模型排名时,它就不再只是测量工具,也会反过来改变训练行为。

开发者会围绕它选数据、调参数、设计提示和修补错误。最终出现的提升,可能来自:

这和学校中的“教学围着考试转”非常相似:学生分数提高了,但考试与真实能力之间的关系反而变弱。

第四副镜头:RLHF里的“老师”是谁

通过人类反馈进行强化学习,本质上会让模型更倾向于产生标注者喜欢的回答。

问题在于,“人类偏好”从来不是一个天然统一的变量。它取决于:

模型可能没有学会一个普遍原则,只是学会了某一批评分者喜欢的语言风格。

因此文章提出,不应只报告一个平均偏好分数,还应报告评分者间一致性、不同评分者群体的影响,以及模型在不同语言、角色设定和社会情境中的稳定性。

文章还进一步指出,用另一个AI生成训练数据时,那个AI同样是“老师”。它自身的偏见、行为倾向和隐含规则,可能作为“隐藏课程”传递给下一代模型。

第五副镜头:安全拒答不等于道德理解

模型在常见危险提示下稳定拒答,只能证明它在这些条件下表现出了可靠行为。

这不等于它:

作者建议用新的价值冲突、提示改写、角色切换、多语言输入和对抗性包装来测试对齐。如果模型换个角色、换种语言或换个叙事框架就改变立场,那么所谓对齐可能只是模板化服从。

五点建议

作者最终把框架压缩为五件事:

  1. 记录训练课程

:公开不同阶段的数据来源、顺序和难度特征; 2. 开展脚手架撤除实验

:报告有提示和无提示、使用工具和不使用工具时的差异; 3. 把Benchmark当成高风险测量工具

:提前识别捷径,并设定更新与退役机制; 4. 审计教师信号

:记录人类标注者和AI教师的构成、规范、一致性与来源; 5. 区分行为与理解

:可靠拒答可以称为可靠行为,不应直接写成“内化了价值观”。

这五条其实构成了一份很实用的模型评测审查表

核心结论

文章把大模型开发重新描述为一套类似教育过程的系统:

作者认为,现有大模型取得更高分,并不等于它获得了更强的能力。它可能只是更依赖提示、更擅长迎合评分者,或者更会钻评测规则的空子

分享人:王彭,天天

审核:PsyBrain 脑心前沿编辑部

💡 关于我们

👋 你好,这里是「PsyBrain 脑心前沿」

🧠 专注追踪全球认知神经科学的最尖端突破

🔍 视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

📄 每日速递「深度解读」与「前沿快讯」

科研是一场探索未知的长跑,但你无需独行。欢迎加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

👇点击卡片进群,欢迎你的到来👇

图2

一键关注,点亮星标 ⭐ 前沿不走丢!

图3

图4

图5

一键分享,让更多人了解前沿

预览时标签不可点

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图6

微信扫一扫可打开此内容,
使用完整服务

返回板块首页