🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / 决策与强化学习:顶刊文献解读专题 / A · 文献解读 / A065 · NHB重磅新发:我们以为的“强化学习”,可能只是工作记忆

A065 NHB重磅新发:我们以为的“强化学习”,可能只是工作记忆与习惯产生的假象?

来源:公众号 PSY-Brain_Frontier | 发布:2025-11-18 | 原文链接

PsyBrain 脑心前沿 | 公众号 PSY-Brain_Frontier

一键关注,点亮星标 ⭐️

不错过每日前沿资讯

认知神经科学前沿文献分享

图1

基本信息

Title:A habit and working memory model as an alternative account of human reward-based learning

发表时间:2025.11.17

Journal:Nature Human Behaviour

影响因子:16.0

获取原文:

  1. 后台回复“文献”即可获取PDF版本
  2. 点击页面底部“阅读原文”即可跳转论文原网页(本论文开放获取,可直接下载PDF)

图2

图3

研究背景

在认知神经科学领域,我们的大脑常被描绘为一台精密、高效的“奖赏驱动机器”。从选择餐厅到学习新技能,我们似乎总在强化学习 (Reinforcement Learning, RL) 框架的指引下行动。这一理论框架取得了巨大的成功,它不仅在算法层面描述了学习过程,还似乎完美地“桥接”了行为与大脑 。

图4

经典的不基于模型的 (model-free) RL 理论认为,大脑通过计算奖励预测误差 (Reward Prediction Errors, RPEs) 来更新对价值的预期,而这一计算过程被广泛认为由多巴胺 (dopamine) 信号所承载,并在以纹状体 (striatum) 为核心的脑区中实现 。这套叙事简洁、有力,似乎统一了计算、行为与神经机制。

然而,这一完美的图景可能“过于完美”了。人类在执行奖励学习任务时,真的只依赖这一种RL计算吗?工作记忆 (Working Memory, WM)(例如,“我刚试了A选项,错了,我记住它”)和简单的选择固执 (choice perseveration)(例如,“我就是习惯选这个”)是否也在发挥作用?

核心的“陷阱”在于,RL 模型家族具有高度的灵活性。这种灵活性使得它们能够成功地“拟合”或“捕捉”那些实际上可能由其他认知过程(如WM)驱动的行为。这导致了一个严峻的风险:归因错误 (misattribution) 。换言之,我们可能一直以来都错误地将工作记忆或习惯的贡献,归功于了RL 算法。

那么,当我们用实验手段“剥离”掉工作记忆等过程的贡献后,人类的奖励学习行为中,还有多少是真正的RL 过程在支撑?这正是发表于 Nature Human Behaviour的这项新研究所要回答的关键问题 。

图5

研究核心总结

这项研究通过对7个数据集(n=594)进行再分析和计算建模,对人类奖励学习的RL 框架提出了根本性的挑战。

图6

研究的核心发现可凝练为以下几点:

  1. 证伪标准强化学习RL模型的关键预测

研究首先利用了经典的RLWM 范式,该范式通过操控工作记忆负荷(即集合大小),来解析工作记忆和慢速RL 过程各自的贡献。

图7

Fig. 1: Protocol, behaviour and predictions.

  1. 替代方案:WMH (工作记忆 + 习惯) 模型

研究表明,人类的奖励学习行为,可以被一个完全不包含标准RL算法的新模型,即WMH 模型更好地解释。该模型在定量拟合和定性模式上均优于所有RLWM 变体 。

WMH 模型假设,人类的工具性学习 (instrumental learning) 是由两个非RL过程混合而成的 :

图8

Fig. 2: Mixture models with WM and H capture errors better than mixture models with WM and RL.

图9

Fig. 3: Quantitative model comparison confirms a better fit for the WM=H than the WMRL family of models.

  1. H-agent:一个“盲目”的、非RL的学习机制

这是本研究最核心的洞见。这个作为学习“慢系统”的H-agent,其运行机制根本不是RL。

图10

Fig. 4: Results replicate in a probabilistic learning task.

  1. “自举” (Bootstrap) 假说:两个非RL过程如何“扮演”RL

如果H-agent 无法区分对错,那么整个系统是如何学习的?模拟研究(见下图)揭示了一个精巧的机制:H-agent 的学习是被WM-agent 所“自举” (bootstrapped) 的 。

图11

Fig. 5: H agents learn to mimic an RL policy when WM contributes to guiding choice.

图12

结论

该研究在所分析的数据集中,“没有发现标准基于价值的无模型RL (standard value-based model-free RL) 贡献于学习的证据” 。

论文作者Anne Collins认为,这一发现具有重大的警示意义。它表明,RL模型虽然在拟合行为数据时非常有用,但它们可能只是捕捉了行为的方差,而并未捕捉到支撑该行为的、真实的动态认知过程。

这种归因错误对于计算精神病学和基于模型的神经影像分析尤为关键 。例如,以往在精神分裂症 或发育性研究  中观察到的所谓“RL缺陷”,可能根本不是RL系统的损伤,而更可能是WM系统的缺陷,或是WM与H过程混合比例的改变。这项工作呼吁我们未来在解释RL相关发现时必须更加谨慎 。

图13

Abstract

Reinforcement learning (RL) algorithms have had tremendous success accounting for reward-based learning across species, including instrumental learning in contextual bandit tasks, and they capture variance in brain signals. However, reward-based learning in humans recruits multiple processes, including memory and choice perseveration; their contributions can easily be mistakenly attributed to RL computations. Here I investigate how much of reward-based learning behaviour is supported by RL computations in a context where other processes can be factored out. Reanalysis and computational modelling of 7 datasets (n = 594) in diverse samples show that in this instrumental context, reward-based learning is best explained by a combination of a fast working-memory-based process and a slower habit-like associative process, neither of which can be interpreted as a standard RL-like algorithm on its own. My results raise important questions for the interpretation of RL algorithms as capturing a meaningful process across brain and behaviour.

图14

Author information

独立作者: Anne G. E. Collins

Department of Psychology, University of California, Berkeley, Berkeley, CA, USA

美国加利福尼亚州,加州大学伯克利分校心理学系

Helen Wills Neuroscience Institute, University of California, Berkeley, Berkeley, CA, USA

美国加利福尼亚州,加州大学伯克利分校,威尔斯神经科学研究所

图15

推荐相关阅读

周报-20251020|认知神经科学前沿动态周览**⭐️[解读链接]****

周报-20251006 | 近两周解读的29篇顶刊论文汇总 | 认知神经科学前沿动态 ⭐️[解读链接]

周报-20250922 |认知神经科学前沿动态周览 *⭐️[解读链接]***

Nature |决策过程的动力学机制与神经模式转变 ⭐️[解读链接]

Nature |颠覆认知 ! “神经振荡”不成立?耶鲁团队提出大脑“伽马事件”新理论  ⭐️[解读链接]

Science |中国将领衔未来25年全球脑计划,剑指灵长类大脑地图  *⭐️[解读链接]***

Neuron |大脑如何区分现实与想象?伦敦大学学院团队最新研究揭秘“现实信号”的神经密码 ⭐️[解读链接]

Nature | 视觉系统新发现:压缩式的物体识别机制 ⭐️[解读链接]

Nat Hum Behav|你不是天生就爱跟风:社会特征学习理论揭示人类“随大流”背后的秘密  *⭐️[解读链接]***

Nature |“读心术”成真?从瞳孔变化中解码大脑皮层完整时空动态 ⭐️[解读链接]

PNAS|刷短视频停不下来?研究揭示“新奇感”是驱动人类探索的古老密码 *⭐️[解读链接]***

Neuron | 最强脑发育数据库RBC开放下载,6000+青少年大脑数据揭示精神健康的秘密 ⭐️[解读链接]

Nature 子刊综述|大脑预测误差的核心回路 *⭐️[解读链接]***

前沿交流 | 欢迎加入认知神经科学前沿交流群!⭐️[解读链接]

图16

核心图表、方法细节、统计结果与讨论见原文及其拓展数据。

点击左下角 “阅读原文” 可跳转到论文源网站界面。

分享人:饭哥

审核:PsyBrain 脑心前沿编辑部

图17

PsyBrain 脑心前沿

带你了解心理学、脑科学的前沿知识与技术流程

预览时标签不可点

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图18

微信扫一扫可打开此内容,
使用完整服务

返回板块首页