A049 Nat Hum Behav | 挑战经典强化学习教条:由于记忆存在,人类奖励学习远比Q-learning复杂
来源:公众号 PSY-Brain_Frontier | 发布:2026-02-15 | 原文链接
PsyBrain 脑心前沿 | 公众号 PSY-Brain_Frontier
一键关注,点亮星标 ⭐️
不错过每日前沿资讯
🧠 PsyBrain · 寒假提升计划 💪
你是否经历过这样的时刻:面对海量的 sMRI、fMRI 或 EEG 数据,不知从何下手构建 Pipeline? 为了跑通一个模型,在 GitHub 和论坛之间反复横跳,甚至和 AI 纠缠半天却依然报错? 明明有着绝佳的实验结果,却不知道怎么画脑袋,更不知道论文里那些漂亮的 🧠 是怎么来…
数据分析原理、实践与可视化本该是通往真理的桥梁,但往往成为阻碍你探索科学的高墙。
今年,我们联手国内顶尖名校博士和资深硕博生为你打造了一套认知神经科学全栈工具箱。从经典的sMRI、fMRI、dMRI、EEG/MEG,到硬核的 电生理、脑机接口,再到前沿的 RSA、MVPA、强化学习、认知建模、大语言模型,我们一站式配齐,欢迎查看~
课程时间 2026年2月24-28日,部分开设在3月初,报名截止 2026年2月17日。
考虑到报名人数和授课老师的时间安排,仍开设的课程如下,欢迎垂询~
报名截止 2 天倒计时~ 报名截止倒计时十天 | 面向心理学、认知神经科学同学的寒假提升班
认知神经科学前沿文献分享

基本信息
Title:Hybrid neural–cognitive models reveal how memory shapes human reward learning
发表时间:2026.2.5
发表期刊: Nature Human Behaviour
影响因子:15.9
获取原文:
- *添加小助手:*PSY-Brain-Frontier即可获取PDF版本
- 点击页面底部“阅读原文”即可跳转论文原网页


研究背景
在当下的认知神经科学与人工智能交叉领域,我们如何理解人类的“学习”与“决策”?

长期以来,经典的强化学习(Reinforcement Learning, RL)模型,尤其是Q-learning及其变体,一直是我们解释大脑奖励学习机制的“圣经”。这些模型假设大脑极为“吝啬”,它不会记住过去发生了什么,而是将所有历史经验压缩成一个简单的数值(Q值)。每当新结果出现,大脑就通过预测误差(RPE)微调这个数值。这种“增量更新(Incremental Updating)”的假设简洁优美,且在多巴胺系统的解释上取得了巨大成功。
然而,随着研究的深入,心理学家和神经科学家们发现这套理论越来越“捉襟见肘”。人类的行为远比简单的Q值更新复杂得多:我们会受到近期奖励趋势的影响(是越来越好还是越来越差?),我们会根据情境调整策略,甚至在看似随机的任务中表现出复杂的周期性探索模式。这些现象暗示了我们的决策系统并非只是简单的“加减分”,而是依赖于一个丰富、高维且多时间尺度的记忆系统。
那么,大脑究竟是如何利用记忆来塑造奖励学习的?传统的认知模型(解释性强但预测力弱)与现代的深度神经网络(预测力强但如同黑盒)之间,是否存在一座桥梁?本研究通过一种创新的“混合神经-认知建模(Hybrid Neural-Cognitive Modeling)”方法,试图打破这一僵局,揭示记忆在人类奖励学习中的真实角色。

研究核心总结
本研究由Google DeepMind与牛津大学、普林斯顿大学等机构的学者合作,2026年2月5日发表于Nature Human Behaviour。研究团队通过对大规模人类行为数据集(862名被试,超60万个试次)的分析,挑战了传统RL模型的核心假设,并提出了全新的解释框架。

Fig. 1 | Overview.
核心发现:超越简单的增量更新
研究者构建了一系列模型,从经典的“最佳RL模型”(Best RL)到完全灵活的“纯循环神经网络”(Vanilla RNN)。结果显示,即便是经过精心设计的经典RL模型,在预测人类行为时也远逊于通用RNN。这说明人类的决策包含大量传统模型无法捕捉的信息。
为了打开RNN的“黑盒”,研究团队设计了名为Memory-ANN的混合模型。该模型在保持认知架构可解释性的同时,利用神经网络替换了关键的计算组件。结果表明,Memory-ANN在预测精度上能够与纯RNN媲美,且显著优于所有传统RL变体。这证明了人类的奖励学习不能仅靠“更新Q值”来解释,必须引入一个独立的、能够追踪复杂历史的记忆模块。

Fig. 2 | Best RL and RL-like models.
机制解释:记忆状态调节奖励敏感度
Memory-ANN揭示了人类决策背后的独特机制,其核心在于将“记忆(Memory)”与“决策值(Choice/Q-value)”解耦:
- 多时间尺度的历史表征:模型内部维护着一个循环的隐状态(Hidden State),这个状态能够同时编码最近的奖励历史(短期记忆)和长期的环境统计特征(长期记忆)。
- 情境依赖的计算:传统的RL模型中,奖励直接更新价值。而在Memory-ANN中,当前的记忆状态会“调节”大脑对新奖励的处理方式。具体而言,记忆状态(特别是其主成分)控制了从奖励到价值映射的“增益(Gain)”。这意味着,同样的奖励在不同的历史背景下(例如,是在连胜之后还是连败之后),会被大脑赋予完全不同的主观价值。
- 捕捉复杂行为模式:该模型成功复现了人类特有的行为特征,例如对“奖励变化趋势”的敏感性(人类倾向于选择奖励正在变好的选项,而传统RL则只看平均值),以及结构化的探索行为(如周期性的尝试不同选项)。

Fig. 3 | Interpretability.
关键意义
这项研究不仅在方法论上展示了如何利用深度学习来发现认知理论(AI for Science),更在理论上对强化学习框架进行了重大修正。它指出,人类的奖励学习并非是一个简单的马尔可夫决策过程,而是一个深受情景记忆调节的动态过程。
这一发现暗示了大脑中可能存在两套协同工作的系统:一套(如海马体或前额叶)负责维护丰富的情景记忆和上下文状态,另一套(如纹状体)则在此基础上计算具体的行动价值。这为我们理解成瘾、焦虑等涉及奖赏回路异常的疾病提供了新的计算视角:也许问题的根源不在于“价值计算”出错了,而在于“记忆背景”被错误地提取或表征了。

Fig. 4 | Behavioural model validation.

Abstract
A long-standing challenge for psychology and neuroscience is to understand the transformations by which past experiences shape future behaviour. Reward-guided learning is typically modelled using simple reinforcement learning (RL) algorithms. In RL, a handful of incrementally updated internal variables both summarize past rewards and drive future choice. Here we describe work that questions the assumptions of many RL models. We adopt a hybrid modelling approach that integrates artificial neural networks into interpretable cognitive architectures, estimating a maximally general form for each algorithmic component and systematically evaluating its necessity and sufficiency. Applying this method to a large dataset of human reward-learning behaviour, we show that successful models require independent and flexible memory variables that can track rich representations of the past. Using a modelling approach that combines predictive accuracy and interpretability, these results call into question an entire class of popular RL models based on incremental updating of scalar reward predictions.

请打分
这篇刚刚登上 Nature Human Behaviour 的研究,是否实至名归?我们邀请您作为“云审稿人”,一同品鉴。精读全文后,欢迎在匿名投票中打分,并在评论区分享您的深度见解。
前沿交流| 欢迎加入认知神经科学前沿交流群!
⭐️[入群链接]

核心图表、方法细节、统计结果与讨论见原文及其拓展数据。
分享人:饭鸽儿
审核:PsyBrain 脑心前沿编辑部
预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务