X011 TICS | 为什么 AI 越会预测文字,越不像人在阅读?
来源:公众号 PSY-Brain_Frontier | 发布:2026-06-17 | 原文链接

认知神经科学前沿文献分享
基本信息
Title: To model human linguistic prediction, make LLMs less superhuman
发表时间: 2026-06-12
发表期刊: Trends in Cognitive Sciences
影响因子: 17.2
获取原文:
-
添加小助手: PSY-Brain-Frontier 即可获取PDF版本
-
点击页面底部“阅读原文”跳转论文网页

领域背景与痛点
语言理解具有预测性:词语可预测性会影响阅读时间、眼动和神经反应。过去,研究者常用语言模型的惊奇值(surprisal)估计人类对下一个词的预期,并假设模型越会预测文本,越能解释阅读行为。但近年主流大语言模型(large language models, LLMs)在下一个词预测上更强后,反而与人类阅读时间拟合下降,说明“预测准确”不等于“像人预测”
核心框架与整合逻辑
这篇 Perspective 将 LLM 与人类预测的偏离整理为两类记忆能力不匹配。长期记忆上,主流 LLM 接触海量训练文本,并可能保持远超普通读者的事实、固定表达和文本片段;短期记忆上,Transformer 可近乎无衰减地访问长上下文中的早先词语,而人类阅读受工作记忆、遗忘和干扰限制。作者因此把评价重点从下一个词准确率,转向训练暴露、知识熟悉度、上下文访问、词汇预测尖锐性与语义预测扩散性是否符合人类限制
关键洞察与未来方向
洞察一:预测更准可能降低认知拟合
早期 n-gram 与神经语言模型研究显示,预测准确率提升可改善阅读时间拟合;但约 2022 年后,更强 Transformer LLM 在 Natural Stories Corpus 和 Dundee Corpus 中出现反转,准确率继续提高时,与人类阅读行为的对齐反而下降

Table 1 用来组织 cloze task、n-gram language models 与 LLM 的词可预测性估计局限;Fig. 1 用来组织模型预测准确率与人类阅读时间拟合关系的文献综合模式
洞察二:长期记忆偏差仍是有边界的假说
作者提出,LLM 的事实知识、训练文本记忆和固定表达熟悉度可能使其预测出普通读者难以预测的词,尤其在专名、领域知识、多词表达和著名文本中。但正文将部分证据限定为 preliminary correlational evidence,不能把全部偏离都归因于长期记忆

Fig. 2 用概念框架图组织 LLM 与人类在事实知识、长期记忆和短期记忆上的差异;这一图表帮助说明“超人记忆”如何改变词预测分布
洞察三:未来对齐需要模型限制与人类实验并行
作者建议探索人类规模训练数据、替代训练目标、temperature scaling、model editing、局部注意偏置、记忆检索瓶颈和 recurrent neural network architecture,同时用直接操纵知识熟悉度、间隔文本、列表大小和实体位置的人类实验建立基准

Box 1 用 targeted experiment sidebar 组织长期记忆与短期记忆假说的实验检验路径;这一图表帮助说明未来工作需要从观察性语料比较走向受控人类实验
省流总结
这篇 Perspective 的核心贡献,是把“LLM 能否模拟人类语言预测”从单纯追求下一个词准确率,转向检验模型是否具有人类式长期知识边界与短期记忆限制。它不是否定 LLM,而是指出认知建模需要更少超人记忆、更接近人类遗忘与干扰机制的模型和实验基准
暑期提升




分享人:天天
审核:PsyBrain 脑心前沿编辑部
💡 关于我们
👋 你好,这里是「PsyBrain 脑心前沿」
🧠 专注追踪全球认知神经科学的最尖端突破
🔍 视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊
📄 每日速递「深度解读」与「前沿快讯」
科研是一场探索未知的长跑,但你无需独行。欢迎加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。
👇点击卡片进群,欢迎你的到来👇
一键关注,点亮星标 ⭐ 前沿不走丢!


一键分享,让更多人了解前沿
预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务


