🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / 科研分析:认知神经科学前沿的结构化精读 / J · 决策与强化学习 / J011 · 最新Science正刊报道强化学习领域新发现:奖赏大小决

J011 最新Science正刊报道强化学习领域新发现:奖赏大小决定强化学习效率!

来源:公众号 PSY-Brain_Frontier | 发布:2026-05-29 | 原文链接

图1

认知神经科学前沿文献分享

基本信息

Title: Reward magnitude determines reinforcement learning efficiency

发表时间: 2026-05-21

发表期刊: Science

影响因子: 45.8

获取原文:

  1. 添加小助手: PSY-Brain-Frontier 即可获取PDF版本

  2. 点击页面底部“阅读原文”跳转论文网页

图2

研究背景

无论是在人工智能的算法训练中,还是在实验心理学的动物行为训练里,领域内长期存在一个默认假设:学习率(决定学习效率的参数)相对独立于奖励的大小。基于这一假设,现代系统神经科学在训练小鼠时,通常采用“少量多次”的策略:每次只给极小体积的水或食物(通常不到小鼠日常需求的 1%),以此来最大化动物在单次训练中的尝试次数。

图3

然而,这种标准的实验室操作真的是最优解吗?近年来,关于多巴胺(DA)功能的理论研究提出,中脑多巴胺的活动可能直接映射了学习过程中的“学习率”。既然经典实验早已证明多巴胺的活动强度与奖励大小高度相关,这就引出了一个反直觉的科学问题:奖励的绝对大小,是否直接决定了强化学习的效率?

这篇最新发表在 Science 上的研究正是为了回答这一问题。研究者不仅挑战了传统训练范式,还试图弄清楚:如果我们把奖励放大十倍甚至几十倍,动物的学习能力究竟会被激发到什么程度?其背后的神经生物学机制又是什么?

研究核心总结

这项研究通过多种行为学范式结合多巴胺荧光探针(dLight/GRAB-DA)和光遗传学技术,系统拆解了奖励大小、多巴胺释放与学习效率之间的因果关系。

一、超大奖励成倍提升操作性任务的学习效率

研究者首先在一个隐藏目标导航任务中测试了小鼠。对照组采用领域标准的 5 μl 奖励(每小节约 180 次),而实验组则采用极少的超大奖励(100 μl,每小节仅 9 次)。结果令人震惊:尽管两组获得的总奖励量相同,但大奖励组小鼠达到熟练水平所需的试次(trials)减少了一个数量级。它们在极少的强化经历后,就能迅速提高奔跑速度并精准锁定目标。这表明,在标准小奖励范式下,动物真实的学习潜力被严重低估了。

图4

Fig 1. 隐藏位置导航任务表明,相较于标准的 5 μl 小奖励,100 μl 的超大奖励能让小鼠在经历极少次数的强化后,迅速达到渐进线水平的优异表现。

二、大奖励通过消除“脱接状态”并促进跨期巩固来加速学习

为了弄清大奖励为何能加速学习,研究者深入剖析了单次训练(within-session)和跨期训练(across-session)的行为动态。他们发现,学习效率实际上由三个关键要素决定:初始学习率、对前次训练成果的跨期保留能力,以及持续参与任务的专注度。

在标准小奖励下,小鼠的表现呈现“U型”曲线:刚开始有进步,但到了训练中后期,小鼠会出现状态依赖的“脱接(disengagement)”,表现急剧下降,且第二天往往无法完全保留前一天的最佳状态。相反,大奖励不仅提高了初始学习率,让小鼠在第二天能完美继承前一天的最佳表现,更关键的是,它几乎彻底消除了小鼠在训练后期的“脱接”现象。

图5

Fig 2. 行为动态分析揭示,标准奖励下小鼠极易在训练中后期陷入“脱接”状态(表现断崖式下跌),而大奖励有效维持了任务专注度并提升了跨天记忆保留率。

三、延长多巴胺释放可模拟大奖励的促学习与专注效应

大奖励在伏隔核(NAc)引发了幅度更大、持续时间更长的多巴胺释放。这是否就是加速学习的直接原因?研究者在小鼠获得标准小奖励时,同步给予腹侧被盖区(VTA)多巴胺神经元光遗传刺激。

结果显示,短暂的光刺激(模拟小奖励的多巴胺反应)只能提升初始学习率;而延长的光刺激(模拟超大奖励的多巴胺反应)不仅提升了学习率,还成功阻止了小鼠的“脱接”状态。不过,任何形式的光刺激都未能重现大奖励带来的“跨期保留”增益,暗示记忆的跨天巩固可能还需要多巴胺以外的神经调节系统(如乙酰胆碱或去甲肾上腺素)参与。

图6

Fig 3. 光遗传学实验证明,只有模拟大奖励的“延长型”多巴胺刺激,才能在提升学习率的同时有效减少动物的任务脱接。

四、大奖励的增益效应可泛化至高难度运动与复杂决策任务

这种大奖励带来的奇效并非只存在于简单的导航任务中。研究者进一步引入了需要付出高体力的“拉操纵杆任务”以及国际大脑实验室(IBL)标准化的“复杂感知决策任务”。在这些任务中,即使只是在常规训练中随机穿插 5% 到 15% 的大奖励,也能显著提高小鼠克服困难任务的成功率,并大幅缩短达到专家级表现所需的训练周期。

图7

Fig 4. 在基于努力的操纵杆任务中,穿插提供大奖励显著提升了小鼠在面对高阻力(高难度)试次时的成功率和学习速度。

图8

Fig 5. 在 IBL 视觉感知决策任务中,大奖励组小鼠不仅学得更快,而且在最终的专家阶段表现出更低的错误率和更小的行为方差。

五、边界条件:大奖励在经典条件反射中会损害线索辨别

好的科学研究必须明确现象的边界。研究者发现,大奖励的“魔法”在巴甫洛夫经典条件反射(如听到声音等待奖励)中失效了。当引入超大奖励作为预期结果时,小鼠不仅没有学得更快,反而丧失了区分“有奖励线索”和“无奖励线索”的能力。超大奖励扰乱了小鼠的预期性舔水行为,也让多巴胺系统失去了对“奖励遗漏”的负向预测误差反应。这说明,大奖励主要促进需要主动控制的操作性技能学习,而在被动联结学习中可能是一把双刃剑。

图9

Fig 6. 在巴甫洛夫线索辨别任务中,超大奖励反而损害了小鼠对不同声音线索的辨别能力,并改变了多巴胺对预期价值的编码保真度。

研究意义

这项工作在理论和方法学上都具有重要的启发意义。

在理论层面,它直接挑战了经典强化学习模型中“学习率独立于奖励大小”的假设。研究证明,中脑边缘多巴胺系统的活动不仅传递奖励预测误差,其释放的规模和持续时间还深刻调控着动物的认知投入(engagement)和学习速率。这为整合多巴胺在“学习”与“动机”两大领域的分歧提供了新的统一视角。

在方法学与应用层面,这项研究给所有从事动物行为学和神经科学的同行敲响了警钟:我们长期依赖的“极小奖励、海量试次”的标准训练范式,可能严重压抑了动物真实的认知潜能。此外,大奖励通过延长多巴胺释放来消除“脱接状态”的机制,与人类注意力缺陷障碍(ADHD)患者使用多巴胺再摄取抑制剂(如哌甲酯)来恢复任务专注度的临床现象高度吻合,为未来探究注意力缺陷的神经环路机制提供了极具价值的动物模型。

分享人:饭鸽儿

审核:PsyBrain 脑心前沿编辑部

💡 关于我们

👋 你好,这里是「PsyBrain 脑心前沿」

🧠 专注追踪全球认知神经科学的最尖端突破

🔍 视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

📄 每日速递「深度解读」与「前沿快讯」

科研是一场探索未知的长跑,但你无需独行。欢迎加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

👇点击卡片进群,欢迎你的到来👇

图10

图11

一键关注,点亮星标 ⭐ 前沿不走丢!

图12

图13

一键分享,让更多人了解前沿

预览时标签不可点

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图14

微信扫一扫可打开此内容,
使用完整服务

返回板块首页