🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / 决策与强化学习:顶刊文献解读专题 / A · 文献解读 / A061 · NatCommun:前额叶皮层通过“时间复用”解决价值学

A061 Nat Commun:前额叶皮层通过“时间复用”解决价值学习中的“稳定性-灵活性困境”

来源:公众号 PSY-Brain_Frontier | 发布:2025-12-19 | 原文链接

PsyBrain 脑心前沿 | 公众号 PSY-Brain_Frontier

一键关注,点亮星标 ⭐️

不错过每日前沿资讯

认知神经科学前沿文献分享

图1

基本信息

Title:Prefrontal cortex temporally multiplexes slow and fast dynamics in value learning and memory

发表时间:2025.12.11

发表期刊:  Nature Communications

影响因子:15.7

获取原文:

  1. *添加小助手:*PSY-Brain-Frontier即可获取PDF版本
  2. 点击页面底部“阅读原文”即可跳转论文原网页

图2

图3

研究背景

在我们的日常生活中,"习惯难改"是一个普遍存在的现象。无论是戒烟时的复吸,还是在面对熟悉事物发生变化时的适应困难,都指向了一个核心的认知困境:大脑如何在维持长期记忆的稳定性(Stability)与适应环境变化的灵活性(Flexibility)之间取得平衡?

图4

一方面,为了生存,我们需要快速学习新规则(例如,原本喜欢的餐厅突然变难吃了,需要立刻停止光顾);另一方面,有用的价值记忆需要缓慢遗忘,以保留那些长期稳定的关联(例如,父母的饭菜总是好吃的)。这种张力被称为“稳定性与灵活性的困境”(stability vs. flexibility dilemma)。

现有的强化学习(RL)理论通常假设一个单一的过程来学习和更新价值。然而,这种单速率模型难以解释为什么我们在经历了一段时间的“反转学习”后,往往会自发地恢复到最初的偏好,即自发恢复(Spontaneous Recovery)现象。此前的研究发现基底神经节中的不同区域(尾状核头部和尾部)分别负责快速和慢速学习,但在皮层层面,大脑究竟是如何整合这两套截然不同的时间尺度,尤其是在同一个脑区内如何处理这种冲突,仍是一个未解之谜。本研究聚焦于腹外侧前额叶皮层(vlPFC),通过一项设计精巧的猕猴价值反转实验,试图揭示大脑解决这一困境的神经计算机制。

图5

研究核心总结

本研究结合了计算建模、电生理记录和行为实验,揭示了腹外侧前额叶皮层(vlPFC)通过时间多路复用(Temporal Multiplexing)机制,在单神经元水平上同时编码了价值学习中的慢速(稳定)和快速(灵活)动态。

图6

Fig. 1 | Value reversal paradigm, model predictions, and behavioral results.

  1. 行为学证据:双速率模型优于单速率模型

研究团队首先通过猕猴的价值反转任务发现,动物在经历价值反转(好刺激变坏,坏刺激变好)并经过一段无反馈的“遗忘期”后,表现出了显著的自发恢复现象,即重新偏向最初的高价值刺激。

通过对比单速率和双速率强化学习模型,研究表明只有包含“快过程”(高学习率、高遗忘率)和“慢过程”(低学习率、低遗忘率)的双速率模型(Two-rate Model)才能准确预测这一行为。快过程负责快速适应环境突变,而慢过程则维持长期的价值记忆。

图7

Fig. 2 | Example neuron and average population response in value probes.

  1. 神经机制:vlPFC的时间多路复用

通过对vlPFC进行单细胞记录,研究者发现这种“快慢双流”并非由不同的神经元群体分别负责,而是由同一群神经元在不同时间窗口交替编码实现的,这被称为时间多路复用机制:

图8

Fig. 3 | Value responses in individual neurons in early and late epochs across value probes.

随着时间的推移(如反转20分钟后),代表快过程的晚期成分迅速衰退,而代表慢过程的早期成分依然保留。这完美地在神经层面解释了为何会出现“自发恢复”:当快速适应的覆盖层消退后,底层的长期记忆便再次显现。此外,局部场电位(LFP)的高伽马波段(High-gamma)功率也显示出了完全一致的时序动态。

图9

Fig. 4 | 2D projection of population responses using partial-PCA across value probes.

  1. 理论与临床意义

该研究具有重要的理论贡献:它证实了大脑通过在同一神经基质上叠加不同时间尺度的计算过程来解决“稳定性-灵活性”难题,而不是单纯依赖解剖上的分离。对于理解成瘾和复发行为,这一发现具有深刻的启示:消退训练(Extinction)往往只是通过“快过程”暂时抑制了行为,而并未擦除由“慢过程”编码的长期价值记忆,这正是习惯难改和复吸的神经计算根源。vlPFC作为整合这两类信息的关键枢纽,可能成为干预适应不良行为的重要靶点。

图10

Fig. 5 | LFP response to good and bad objects across value probes and correlations with behavior.

图11

Abstract

Balancing stability and flexibility is a fundamental challenge in value-based learning: how does the brain maintain long-term value memories while adapting to new environmental contingencies? To address this, we propose a reinforcement learning model composed of two distinct processes with fast and slow dynamics for updating and forgetting object values. Using a combined theoretical and experimental approach in male macaque monkeys, we validate a key behavioral prediction of this two-rate system—spontaneous recovery of prior value memories following value reversal. At the neural level, we show that single neurons in the ventrolateral prefrontal cortex (vlPFC) temporally multiplex these dynamics, with distinct firing components reflecting fast and slow learning processes. Together, these findings suggest that reward learning and memory are supported by a two-rate system that enables both flexibility and stability, and identify the vlPFC as a critical neural substrate for this mechanism.

前沿交流| 欢迎加入认知神经科学前沿交流群!

⭐️[入群链接]

图12

核心图表、方法细节、统计结果与讨论见原文及其拓展数据。

分享人:饭哥

审核:PsyBrain 脑心前沿编辑部

预览时标签不可点

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图13

微信扫一扫可打开此内容,
使用完整服务

返回板块首页