A002 Nat Commun | 大模型真的像大脑吗?稳健编码方法学下的再检验
来源:公众号 PSY-Brain_Frontier | 发布:2026-10-05 | 原文链接

● 认知神经科学前沿文献分享
论文信息:Spurious alignment between large language models and brains can emerge from non-robust methods and overlooked confounds
发表时间:2026-04-27
发表期刊:Nature Communications


01 模型能预测大脑,就说明它像大脑吗?
大语言模型(Large Language Model,LLM)加工语言的方式和人脑相似吗?常用的检验方法是神经编码(neural encoding):把被试读过或听过的语言材料输入模型,提取各层的内部表征,再用线性回归预测脑响应。预测越准,越容易被解读为模型与大脑“对齐”
这一方向上影响最大的工作来自 Schrimpf 等人(2021)。他们比较了 43 个模型,发现 GPT2XL 的预测力最高,而且模型的下一词预测能力越强,对脑响应的预测也越准,作者据此认为预测性加工塑造了语言理解。未经训练的 transformer 表现也不错,这又被用来说明架构本身带有类脑偏置
这篇 Nature Communications 研究在 Schrimpf 等人用过的三套数据上重新做了分析:Pereira2018(fMRI,逐句阅读)、Fedorenko2016(ECoG,逐词阅读)和 Blank2014(fMRI,收听故事)。作者关心的是这条推断背后的方法前提,测试集怎么切分,激活怎么提取,最简单的混淆变量有没有控制,这些选择都可能改写结论

02 一套“再检验”是怎样搭起来的?
由于作者做的是一套再检验,他们沿用了现有的编码分析流程,把其中几项方法选择当作变量逐一替换,再加入专门设计的简单基线和方差分解,看 LLM 的预测力有多少真正属于它自己
测试集怎么切?
相邻句子的脑响应本来就相似,其中一部分只来自时间上的接近。打乱划分(shuffled splits)随机分配样本,测试句的“邻居”常常落在训练集里,模型只要把时间相近的样本表示得相似,就能拿到分数。连续划分(contiguous splits)则把整段、整句或整个故事留作测试集
激活怎么取?
一个神经样本往往对应多个 token,作者并列比较了三种池化方式:末 token 池化(last-token pooling,也是 Schrimpf 等人的做法)、均值池化(mean pooling)和求和池化(sum pooling)
拿什么当对照?
正交自相关序列模型(OASM)只编码样本在时间上的相邻关系:不同段落或故事的表征彼此正交,同一段落内的相邻样本彼此相似,按构造它在连续划分下的预测力为 0。位置信号与词率(PWR)编码样本在段落、句子或故事中的位置,以及每个样本包含的词数,静态词向量 GloVe 则作为词汇语义基线
作者还用方差分解定义了指标 Ω,表示 LLM 的预测力中有多大比例可以被基线覆盖,越接近 100%,LLM 的独有贡献就越小

03 换成稳健做法之后,看到了什么?
打乱划分下,只懂“时间相近”的模型能打平 GPT2XL 吗?
可以。在接近 Schrimpf 等人的设置下,OASM 在三套数据上的预测力都与 GPT2XL 相当甚至更高。方差分解显示,OASM 能解释 GPT2XL 预测力的 50% 到接近 100%。划分方式甚至会改变最佳层的位置,打乱划分偏向早期层和末端层,连续划分偏向中间层

图 1|两种划分下的对比。a 为打乱划分,b 为连续划分;每组左侧为普通最小二乘(OLS)回归,右侧为 L2 正则化回归。每个点代表一名被试在语言网络内的平均预测力(Pearson r),柱为被试均值。-LAST、-MEAN、-SUM 分别对应末 token、均值和求和池化;Fed2016 即 Fedorenko2016。星号表示 GPT2XL 显著高于 OASM
Schrimpf 等人的核心结论,还剩几条?
改用连续划分、并为每个模型选用最佳池化之后,单向 transformer 相对双向 transformer 和 RWKV 循环网络的优势变得很不稳定。末 token 池化本身就偏袒单向模型,在 Pereira2018 中,用这种池化时有 51.1% 的比较显著偏向单向模型,换成其他池化后降到 10% 以下。“下一词预测能力越强、神经预测力越高”这一关系,也只在把静态词向量纳入比较时才显著,放到上下文模型内部就失去了显著性
LLM 还剩多少“独有”的预测力?
连续划分下,简单基线仍覆盖了 GPT2XL 的大部分预测力,三套数据的 Ω 分别超过 85%、超过 80% 和接近 100%,加入 GPT2XL 后显著改善的只有约 3.4% 的体素和 4.7% 的电极。未经训练的 GPT2XL 结果更明确,Ω 超过 98%,此前归因于架构偏置的预测力,在这些数据上可以完全用位置和词率来解释

图 5|连续划分下 GPT2XL 与基线的比较。a 为各模型的神经预测力;b 为 Pereira2018 左半球语言网络的玻璃脑图;c 在体素、电极和 fROI 层面比较两者;d 为 R² 与 Ω;e 为加入 GPT2XL 后显著改善的比例。Pereira2018 的基线为 PWR + GloVe,其余两套为 PWR
时间自相关、池化偏差和低层混淆被逐一剥离之后,LLM 真正多出来的那部分信息才能被准确地看到

04 我的数据,适合做同样的检查吗?
如果研究准备从“模型表征能预测脑响应”推出“模型与大脑共享某种属性”,或者要在不同模型、层级和训练目标之间比较谁更类脑,都值得先做一遍这套检查,fMRI、ECoG、EEG、MEG 数据配合任意深度网络都可以套用
实际操作时,有时间结构的数据可以按段落、故事或扫描 run 连续切分,并写明每一折的构造方式。一个样本对应多个 token 时,最好并列报告几种池化的结果。位置、词率和刺激时长这类低层变量可以写成基线,再用联合模型和 Ω 检查 LLM 的增量是否依然显著。LLM 单独解释的方差很小时,Ω 最好结合逐体素或逐电极的检验一起看
原研究还比较了 45 个模型,并检验了词汇语义与句法表征能否被位置和词率解释,感兴趣的读者欢迎阅读原文
分享人:小虎
审核:PsyBrain 脑心前沿编辑部
● 原文信息与获取方式
DOI:10.1038/s41467-026-72253-7
获取原文:
-
三连后添加小助手:PSY-Brain-Frontier 获取
-
点击页面底部“阅读原文”跳转论文网页
版权归属作者团队和出版社,本文仅做分享

预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务