A065 NHB重磅新发:我们以为的“强化学习”,可能只是工作记忆与习惯产生的假象?
来源:公众号 PSY-Brain_Frontier | 发布:2025-11-18 | 原文链接
PsyBrain 脑心前沿 | 公众号 PSY-Brain_Frontier
一键关注,点亮星标 ⭐️
不错过每日前沿资讯
认知神经科学前沿文献分享

基本信息
Title:A habit and working memory model as an alternative account of human reward-based learning
发表时间:2025.11.17
Journal:Nature Human Behaviour
影响因子:16.0
获取原文:
- 后台回复“文献”即可获取PDF版本
- 点击页面底部“阅读原文”即可跳转论文原网页(本论文开放获取,可直接下载PDF)


研究背景
在认知神经科学领域,我们的大脑常被描绘为一台精密、高效的“奖赏驱动机器”。从选择餐厅到学习新技能,我们似乎总在强化学习 (Reinforcement Learning, RL) 框架的指引下行动。这一理论框架取得了巨大的成功,它不仅在算法层面描述了学习过程,还似乎完美地“桥接”了行为与大脑 。

经典的不基于模型的 (model-free) RL 理论认为,大脑通过计算奖励预测误差 (Reward Prediction Errors, RPEs) 来更新对价值的预期,而这一计算过程被广泛认为由多巴胺 (dopamine) 信号所承载,并在以纹状体 (striatum) 为核心的脑区中实现 。这套叙事简洁、有力,似乎统一了计算、行为与神经机制。
然而,这一完美的图景可能“过于完美”了。人类在执行奖励学习任务时,真的只依赖这一种RL计算吗?工作记忆 (Working Memory, WM)(例如,“我刚试了A选项,错了,我记住它”)和简单的选择固执 (choice perseveration)(例如,“我就是习惯选这个”)是否也在发挥作用?
核心的“陷阱”在于,RL 模型家族具有高度的灵活性。这种灵活性使得它们能够成功地“拟合”或“捕捉”那些实际上可能由其他认知过程(如WM)驱动的行为。这导致了一个严峻的风险:归因错误 (misattribution) 。换言之,我们可能一直以来都错误地将工作记忆或习惯的贡献,归功于了RL 算法。
那么,当我们用实验手段“剥离”掉工作记忆等过程的贡献后,人类的奖励学习行为中,还有多少是真正的RL 过程在支撑?这正是发表于 Nature Human Behaviour的这项新研究所要回答的关键问题 。

研究核心总结
这项研究通过对7个数据集(n=594)进行再分析和计算建模,对人类奖励学习的RL 框架提出了根本性的挑战。

研究的核心发现可凝练为以下几点:
- 证伪标准强化学习RL模型的关键预测
研究首先利用了经典的RLWM 范式,该范式通过操控工作记忆负荷(即集合大小),来解析工作记忆和慢速RL 过程各自的贡献。
- RL关键的行为预测被证伪: 标准model-free RL 算法的一个核心预测是,负向预测误差 (negative prediction error)(即收到错误反馈)应当使个体力图避免重复该错误选项。然而数据显示,这一预测被“证伪”了:当工作记忆负荷较低时,被试确实能有效避免犯过的错误。然而,一旦工作记忆负荷超载,被试避免重复错误的能力急剧下降乃至消失 。
- 对负面结果不敏感: 在高负荷下,被试的策略似乎对负面结果变得不敏感。更重要的是,在部分数据集中,被试甚至表现出了显著的错误固执效应 (error perseveration effects),即他们更有可能重复那个刚刚被试验证明是错误的选择。
- 标准模型的失败: 无论是单一RL 模型还是RLWM 混合模型,都无法解释这种在高负荷下对负面反馈的“漠视”和“固执”。

Fig. 1: Protocol, behaviour and predictions.
- 替代方案:WMH (工作记忆 + 习惯) 模型
研究表明,人类的奖励学习行为,可以被一个完全不包含标准RL算法的新模型,即WMH 模型更好地解释。该模型在定量拟合和定性模式上均优于所有RLWM 变体 。
WMH 模型假设,人类的工具性学习 (instrumental learning) 是由两个非RL过程混合而成的 :
- WM-agent (工作记忆过程): 一个快速、灵活但容量受限的过程。该过程对奖励结果敏感,能实现快速学习,但在高负荷下会失效 。
- H-agent (类习惯过程): 一个慢速、资源非受限的类习惯联结过程 (associative 'Habit-like' process) 。

Fig. 2: Mixture models with WM and H capture errors better than mixture models with WM and RL.

Fig. 3: Quantitative model comparison confirms a better fit for the WM=H than the WMRL family of models.
- H-agent:一个“盲目”的、非RL的学习机制
这是本研究最核心的洞见。这个作为学习“慢系统”的H-agent,其运行机制根本不是RL。
- 对结果不敏感: H-agent 的核心特性是它不追踪价值。它在更新刺激-动作关联时,完全不关心结果的效价。
- “盲目”更新: 拟合最好的模型显示,H-agent 在收到“错误”反馈时,其关联权重的更新方式与收到“正确”反馈时完全相同。它更像是一个赫布学习 (Hebbian) 或联结主义过程,仅仅追踪“哪些动作被执行过”,而不是“哪些动作是好的”。
- H-agent 的局限: 这样一个“盲目”的、对错误毫不在意的H-agent,如果单独运行,根本无法学习到最优策略,只会倾向于重复它刚做过的动作。

Fig. 4: Results replicate in a probabilistic learning task.
- “自举” (Bootstrap) 假说:两个非RL过程如何“扮演”RL
如果H-agent 无法区分对错,那么整个系统是如何学习的?模拟研究(见下图)揭示了一个精巧的机制:H-agent 的学习是被WM-agent 所“自举” (bootstrapped) 的 。
- 系统交互: 在WMH 混合模型中,当WM 未超载时,“聪明”的WM-agent 会主导选择,它能识别并执行正确的动作,避免错误动作。
- 频率驱动: 尽管H-agent 对结果“盲目”,但它对选择的频率敏感。由于WM-agent 的引导,正确的动作被执行的频率远高于错误的动作。
- 最终结果: H-agent 通过这个简单的、基于频率的资源理性 (resource-rational) 规则 ,最终也学会了(即增强了)那个高频出现的“正确”选项。

Fig. 5: H agents learn to mimic an RL policy when WM contributes to guiding choice.

结论
该研究在所分析的数据集中,“没有发现标准基于价值的无模型RL (standard value-based model-free RL) 贡献于学习的证据” 。
论文作者Anne Collins认为,这一发现具有重大的警示意义。它表明,RL模型虽然在拟合行为数据时非常有用,但它们可能只是捕捉了行为的方差,而并未捕捉到支撑该行为的、真实的动态认知过程。
这种归因错误对于计算精神病学和基于模型的神经影像分析尤为关键 。例如,以往在精神分裂症 或发育性研究 中观察到的所谓“RL缺陷”,可能根本不是RL系统的损伤,而更可能是WM系统的缺陷,或是WM与H过程混合比例的改变。这项工作呼吁我们未来在解释RL相关发现时必须更加谨慎 。

Abstract
Reinforcement learning (RL) algorithms have had tremendous success accounting for reward-based learning across species, including instrumental learning in contextual bandit tasks, and they capture variance in brain signals. However, reward-based learning in humans recruits multiple processes, including memory and choice perseveration; their contributions can easily be mistakenly attributed to RL computations. Here I investigate how much of reward-based learning behaviour is supported by RL computations in a context where other processes can be factored out. Reanalysis and computational modelling of 7 datasets (n = 594) in diverse samples show that in this instrumental context, reward-based learning is best explained by a combination of a fast working-memory-based process and a slower habit-like associative process, neither of which can be interpreted as a standard RL-like algorithm on its own. My results raise important questions for the interpretation of RL algorithms as capturing a meaningful process across brain and behaviour.

Author information
独立作者: Anne G. E. Collins
Department of Psychology, University of California, Berkeley, Berkeley, CA, USA
美国加利福尼亚州,加州大学伯克利分校心理学系
Helen Wills Neuroscience Institute, University of California, Berkeley, Berkeley, CA, USA
美国加利福尼亚州,加州大学伯克利分校,威尔斯神经科学研究所

推荐相关阅读
周报-20251020|认知神经科学前沿动态周览**⭐️[解读链接]****
周报-20251006 | 近两周解读的29篇顶刊论文汇总 | 认知神经科学前沿动态 ⭐️[解读链接]
周报-20250922 |认知神经科学前沿动态周览 *⭐️[解读链接]***
Nature |决策过程的动力学机制与神经模式转变 ⭐️[解读链接]
Nature |颠覆认知 ! “神经振荡”不成立?耶鲁团队提出大脑“伽马事件”新理论 ⭐️[解读链接]
Science |中国将领衔未来25年全球脑计划,剑指灵长类大脑地图 *⭐️[解读链接]***
Neuron |大脑如何区分现实与想象?伦敦大学学院团队最新研究揭秘“现实信号”的神经密码 ⭐️[解读链接]
Nature | 视觉系统新发现:压缩式的物体识别机制 ⭐️[解读链接]
Nat Hum Behav|你不是天生就爱跟风:社会特征学习理论揭示人类“随大流”背后的秘密 *⭐️[解读链接]***
Nature |“读心术”成真?从瞳孔变化中解码大脑皮层完整时空动态 ⭐️[解读链接]
PNAS|刷短视频停不下来?研究揭示“新奇感”是驱动人类探索的古老密码 *⭐️[解读链接]***
Neuron | 最强脑发育数据库RBC开放下载,6000+青少年大脑数据揭示精神健康的秘密 ⭐️[解读链接]
Nature 子刊综述|大脑预测误差的核心回路 *⭐️[解读链接]***
前沿交流 | 欢迎加入认知神经科学前沿交流群!⭐️[解读链接]

核心图表、方法细节、统计结果与讨论见原文及其拓展数据。
点击左下角 “阅读原文” 可跳转到论文源网站界面。
分享人:饭哥
审核:PsyBrain 脑心前沿编辑部

PsyBrain 脑心前沿
带你了解心理学、脑科学的前沿知识与技术流程
预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务