🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / AI 与脑科学:顶刊文献解读专题 / A · 文献解读 / A002 · NatCommun大模型真的像大脑吗?稳健编码方法学下的

A002 Nat Commun | 大模型真的像大脑吗?稳健编码方法学下的再检验

来源:公众号 PSY-Brain_Frontier | 发布:2026-10-05 | 原文链接

图1

● 认知神经科学前沿文献分享

论文信息:Spurious alignment between large language models and brains can emerge from non-robust methods and overlooked confounds

发表时间:2026-04-27

发表期刊:Nature Communications

图2

图3

本文目录
  1. 01 模型能预测大脑,就说明它像大脑吗?
  2. 02 一套“再检验”是怎样搭起来的?
  3. 03 换成稳健做法之后,看到了什么?
  4. 04 我的数据,适合做同样的检查吗?

01 模型能预测大脑,就说明它像大脑吗?

大语言模型(Large Language Model,LLM)加工语言的方式和人脑相似吗?常用的检验方法是神经编码(neural encoding):把被试读过或听过的语言材料输入模型,提取各层的内部表征,再用线性回归预测脑响应。预测越准,越容易被解读为模型与大脑“对齐”

这一方向上影响最大的工作来自 Schrimpf 等人(2021)。他们比较了 43 个模型,发现 GPT2XL 的预测力最高,而且模型的下一词预测能力越强,对脑响应的预测也越准,作者据此认为预测性加工塑造了语言理解。未经训练的 transformer 表现也不错,这又被用来说明架构本身带有类脑偏置

这篇 Nature Communications 研究在 Schrimpf 等人用过的三套数据上重新做了分析:Pereira2018(fMRI,逐句阅读)、Fedorenko2016(ECoG,逐词阅读)和 Blank2014(fMRI,收听故事)。作者关心的是这条推断背后的方法前提,测试集怎么切分,激活怎么提取,最简单的混淆变量有没有控制,这些选择都可能改写结论

图4

02 一套“再检验”是怎样搭起来的?

由于作者做的是一套再检验,他们沿用了现有的编码分析流程,把其中几项方法选择当作变量逐一替换,再加入专门设计的简单基线和方差分解,看 LLM 的预测力有多少真正属于它自己

测试集怎么切?

相邻句子的脑响应本来就相似,其中一部分只来自时间上的接近。打乱划分(shuffled splits)随机分配样本,测试句的“邻居”常常落在训练集里,模型只要把时间相近的样本表示得相似,就能拿到分数。连续划分(contiguous splits)则把整段、整句或整个故事留作测试集

激活怎么取?

一个神经样本往往对应多个 token,作者并列比较了三种池化方式:末 token 池化(last-token pooling,也是 Schrimpf 等人的做法)、均值池化(mean pooling)和求和池化(sum pooling)

拿什么当对照?

正交自相关序列模型(OASM)只编码样本在时间上的相邻关系:不同段落或故事的表征彼此正交,同一段落内的相邻样本彼此相似,按构造它在连续划分下的预测力为 0。位置信号与词率(PWR)编码样本在段落、句子或故事中的位置,以及每个样本包含的词数,静态词向量 GloVe 则作为词汇语义基线

作者还用方差分解定义了指标 Ω,表示 LLM 的预测力中有多大比例可以被基线覆盖,越接近 100%,LLM 的独有贡献就越小

图5

03 换成稳健做法之后,看到了什么?

打乱划分下,只懂“时间相近”的模型能打平 GPT2XL 吗?

可以。在接近 Schrimpf 等人的设置下,OASM 在三套数据上的预测力都与 GPT2XL 相当甚至更高。方差分解显示,OASM 能解释 GPT2XL 预测力的 50% 到接近 100%。划分方式甚至会改变最佳层的位置,打乱划分偏向早期层和末端层,连续划分偏向中间层

图6

图 1|两种划分下的对比。a 为打乱划分,b 为连续划分;每组左侧为普通最小二乘(OLS)回归,右侧为 L2 正则化回归。每个点代表一名被试在语言网络内的平均预测力(Pearson r),柱为被试均值。-LAST、-MEAN、-SUM 分别对应末 token、均值和求和池化;Fed2016 即 Fedorenko2016。星号表示 GPT2XL 显著高于 OASM

Schrimpf 等人的核心结论,还剩几条?

改用连续划分、并为每个模型选用最佳池化之后,单向 transformer 相对双向 transformer 和 RWKV 循环网络的优势变得很不稳定。末 token 池化本身就偏袒单向模型,在 Pereira2018 中,用这种池化时有 51.1% 的比较显著偏向单向模型,换成其他池化后降到 10% 以下。“下一词预测能力越强、神经预测力越高”这一关系,也只在把静态词向量纳入比较时才显著,放到上下文模型内部就失去了显著性

LLM 还剩多少“独有”的预测力?

连续划分下,简单基线仍覆盖了 GPT2XL 的大部分预测力,三套数据的 Ω 分别超过 85%、超过 80% 和接近 100%,加入 GPT2XL 后显著改善的只有约 3.4% 的体素和 4.7% 的电极。未经训练的 GPT2XL 结果更明确,Ω 超过 98%,此前归因于架构偏置的预测力,在这些数据上可以完全用位置和词率来解释

图7

图 5|连续划分下 GPT2XL 与基线的比较。a 为各模型的神经预测力;b 为 Pereira2018 左半球语言网络的玻璃脑图;c 在体素、电极和 fROI 层面比较两者;d 为 R² 与 Ω;e 为加入 GPT2XL 后显著改善的比例。Pereira2018 的基线为 PWR + GloVe,其余两套为 PWR

时间自相关、池化偏差和低层混淆被逐一剥离之后,LLM 真正多出来的那部分信息才能被准确地看到

图8

04 我的数据,适合做同样的检查吗?

如果研究准备从“模型表征能预测脑响应”推出“模型与大脑共享某种属性”,或者要在不同模型、层级和训练目标之间比较谁更类脑,都值得先做一遍这套检查,fMRI、ECoG、EEG、MEG 数据配合任意深度网络都可以套用

实际操作时,有时间结构的数据可以按段落、故事或扫描 run 连续切分,并写明每一折的构造方式。一个样本对应多个 token 时,最好并列报告几种池化的结果。位置、词率和刺激时长这类低层变量可以写成基线,再用联合模型和 Ω 检查 LLM 的增量是否依然显著。LLM 单独解释的方差很小时,Ω 最好结合逐体素或逐电极的检验一起看

原研究还比较了 45 个模型,并检验了词汇语义与句法表征能否被位置和词率解释,感兴趣的读者欢迎阅读原文

分享人:小虎
审核:PsyBrain 脑心前沿编辑部

● 原文信息与获取方式

DOI:10.1038/s41467-026-72253-7

获取原文:

  1. 三连后添加小助手:PSY-Brain-Frontier 获取

  2. 点击页面底部“阅读原文”跳转论文网页

版权归属作者团队和出版社,本文仅做分享

图9 图10 图11 图12 图13 图14

预览时标签不可点

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图15

微信扫一扫可打开此内容,
使用完整服务

返回板块首页