A030 大模型让科研更快,却可能让理解变浅:一篇关于 LLM 与“泛化性幻觉”的提醒
来源:公众号 PSY-Brain_Frontier | 发布:2026-03-12 | 原文链接

一键关注,点亮星标 ⭐️ 前沿不走丢!
认知神经科学前沿文献分享

基本信息
Title:Producing more while understanding less with large language models
发表时间:2026.2.19
发表期刊: Trends in Cognitive Sciences
影响因子:17.2
获取原文:
- *添加小助手:*PSY-Brain-Frontier即可获取PDF版本
- 点击页面底部“阅读原文”即可跳转论文原网页


引言
大语言模型(large language models, LLMs)进入科研之后,最诱人的承诺并不只是“写得更快”,而是“研究得更广”。
在认知科学里,这种想象尤其强烈:如果现实中很难招募足够多、足够多元的人群,是否可以让模型充当“AI 替身(AI Surrogates)”,先替研究者试验问题、筛选任务,甚至模拟历史人群或边缘群体,从而提升研究结论的泛化性(generalizability)?
这篇发表于 *Trends in Cognitive Sciences* 的回应短文,正是对这一思路的直接反驳。
作者 Crockett 和 Messeri 继续沿用他们此前对“AI 替身”的批判框架,回应 Lin 提出的“把 LLM 当工具(LLMs-as-tools)也能增强泛化性”的观点。
文章最值得注意的地方,在于它并不否认 LLM 能显著提高产出效率,而是提醒我们:高效率并不自动等于高理解。尤其当模型建立在有限、失衡、去语境化的文本之上时,研究者很容易把“生成得像”误当成“理解得真”,进一步对历史、文化差异和临床能力形成过度自信。
对今天越来越依赖生成式人工智能(generative artificial intelligence)的科研实践而言,这篇短文像是一脚刹车:它逼着我们重新追问,工具扩张之后,真正增长的究竟是知识,还是幻觉。

实验设计与方法逻辑
这篇文章并非传统实证研究,而是一篇回应性评论。
作者围绕 Lin 提出的三种 LLM 应用场景——历史人群模拟、跨文化研究预实验和临床训练——逐一展开反驳,并结合自己此前提出的“去情境化、工程化、匿名化、去身体化(Decontextualized, Engineered, Anonymized, Disembodied, DEAD)”认知框架,检视训练语料的代表性、文本与真实人的断裂,以及模型在弱势群体表征上的偏差,最终论证 LLM 能加速科研流程,却未必增加对人类认知与行为的真实理解。

核心发现
最该警惕的,不是低效,而是“理解幻觉”
作者在这里提出“理解幻觉(illusions of understanding)”这一总框架:研究者可能把模型输出误当成自己的解释力,把模型能回答的问题误当成问题全集,也把模型覆盖到的文本世界误当成可普遍外推的人类世界。读这一部分要抓住的重点不是“LLM 有没有价值”,而是“它会不会让人过早相信自己已经理解了复杂现象”,而这正是全文所有批评的逻辑起点。
历史语料训练出的模型,不等于历史人群
针对“用历史档案训练 LLM 来检验理论能否跨世纪成立”的设想,作者指出,历史档案本身就高度偏向识字者、富裕者、精英男性和多数族群,因此模型学到的首先是“谁有机会留下文字”,而不是“那个时代的人普遍怎样思考”。这篇回应文没有常规实验图表,但这一段与 Box 1 中的“泛化性幻觉”形成直接呼应:真正需要关注的不是模型能否生成一段像古人的文本,而是这种生成是否被误读成对历史总体人群的可靠代表。
跨文化研究若先让 LLM 试跑,可能一开始就偏了
作者认为,把 LLM 用作跨文化研究的预实验工具,看似节省成本,实则可能让问题更严重。容易接触到的人群仍然接受完整的人类研究,而难接触到的人群却先被压缩成 DEAD 认知的替代品,这会把当前学界已有的结构性不平等进一步自动化。这里虽然没有复杂图表,但论证重点非常清楚:一旦研究是否值得进入真人验证,先由模型试跑结果来决定,那么被保留下来的问题类型本身就会越来越偏向模型擅长处理的、被去语境化的人类行为。
模拟“多元患者”训练临床人员,提升的可能只是自信
在临床训练场景中,作者最担心的不是模型回答不流畅,而是它会制造“我已经会了”的错觉。文中指出,被援引的相关研究更多报告的是学员对自身能力的“感知”和“信心”提升,而不是其真实临床能力已经得到验证;更重要的是,这些案例并没有真正模拟来自边缘群体的患者。读这一段要把握作者的分析逻辑:如果模型本身会系统性误表征弱势群体,那么它带给训练者的很可能不是更高的跨文化胜任力,而是更高的错误自信,最终把风险转嫁给真实患者。

归纳总结和点评
这篇文章的重要性,在于它把关于 LLM 的讨论从“能不能让科研更快”推进到“更快之后我们到底理解了什么”。作为一篇篇幅不长的回应短文,它没有提供新实验,却非常准确地击中了当下最容易被忽略的盲点:代表性不是靠更多文本自动获得的,泛化性也不是靠更快模拟自然长出来的。对认知科学、跨文化研究和临床训练来说,这是一篇分量不重、提醒很重的文章,它迫使研究者在拥抱效率之前,先守住理解的边界。
分享人:BQ
审核:PsyBrain 脑心前沿编辑部
💡 关于我们
👋 你好,这里是「PsyBrain 脑心前沿」
🧠 专注追踪全球认知神经科学的最尖端突破
🔍视野直击 Nature, Science, Cell 正刊 及 Nat Neurosci, Nat Hum Behav, Neuron, Sci Adv 等核心子刊与顶级大刊
📄 每日速递「深度解读」与「前沿快讯」,为你打破信息差
科研是一场探索未知的长跑,但你无需独行。欢迎志同道合的你加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。
👇点击卡片进群,欢迎你的到来👇


一键分享,让更多人了解前沿
预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务
