🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / 决策与强化学习:顶刊文献解读专题 / A · 文献解读 / A064 · 为什么高手能秒懂规则变了?Neuron最新发现揭示眶额叶

A064 为什么高手能秒懂规则变了?Neuron 最新发现揭示眶额叶更新主观信念的机制

来源:公众号 PSY-Brain_Frontier | 发布:2025-11-20 | 原文链接

PsyBrain 脑心前沿 | 公众号 PSY-Brain_Frontier

一键关注,点亮星标 ⭐️

不错过每日前沿资讯

认知神经科学前沿文献分享

图1

基本信息:

Title:The orbitofrontal cortex updates beliefs for state inference

发表时间:2025.11.17

Journal:Neuron

影响因子:15.0

获取原文:

  1. 后台回复“文献”即可获取PDF版本
  2. 点击页面底部“阅读原文”即可跳转论文原网页

图2

图3

省流总结

本研究揭示了眶额叶皮层(OFC)在认知过程中执行的一项精确计算:更新关于隐蔽环境状态的主观信念(State Inference)。作者训练大鼠执行一项带有隐蔽奖励状态(High/Low/Mixed blocks)的时间下注任务。研究发现,训练有素的大鼠(Experts)通过推断隐蔽状态来调整决策,而OFC失活会导致这种信念更新能力受损,使行为退化为被动适应奖励统计数据的策略 。高密度电生理记录结合分层潜变量动力学系统(hLDS)模型显示,OFC的神经群体动力学并不反映简单的奖励历史,而是反映了推断出的状态,并在接收到关键证据(不一致试验)后发生突变 。相比之下,初学阶段的大鼠(Naive)则采用“除法归一化”(divisive normalization)策略,缺乏这种基于推断的神经表征 。

图4

研究动机与背景

现有共识与挑战:为了在动态环境中生存,动物不能仅依赖刺激-反应的简单关联,还需要形成并归纳关于世界的推断 。虽然OFC已知与部分可观测环境下的状态推断、高阶关联学习有关 ,但OFC局部电路动力学究竟如何支持状态推断仍不清楚 。

关键科学问题:状态推断是一个复合的认知过程,涉及先验信念表征、感官观测处理、信念更新等多个子计算 。目前尚不清楚OFC具体支持其中的哪一个子计算环节 。此外,关于神经电路如何计算和表征针对抽象潜在环境状态的信念(而非简单的感知觉推断),目前仍悬而未决 。

研究目的:利用大规模行为数据集、神经微扰(失活)和大规模记录,结合计算模型,旨在确定OFC支持的精确计算功能,并识别支持该功能的神经动力学特征 。

图5

实验设计与方法逻辑

为了分离并验证“状态推断”这一认知过程,作者设计了一项精巧的“时间下注任务”(temporal wagering task),其中奖励的大小由声音提示,但奖励的统计分布(High/Low blocks)是隐蔽的,迫使大鼠根据奖励历史推断当前的隐蔽状态(Block)以决定等待奖励的时间 。为了验证OFC的因果作用,作者对比了正常状态与注射Muscimol(GABA激动剂)使OFC失活后的行为表现,并引入计算模型(推断模型 vs. 除法归一化模型)来拟合行为数据,从而确认OFC失活是否特异性地损害了基于贝叶斯规则的信念更新过程 。为了揭示神经机制,作者使用Neuropixels探针记录了OFC及其他脑区(如M1, V2)的大规模神经元活动,并利用分层线性动力学系统(hLDS)模型将神经活动分解为快时间尺度(试验内)和慢时间尺度(试验间)的潜变量 。特别是,作者利用“不一致试验”(Incongruent trials,即明确指示状态发生变化的试验)作为“试金石”,分析神经活动在这一关键时刻前后是否表现出符合“推断”特征的突变,从而将真正的状态推断与渐进式的联想学习区分开来 。

图6

基本假设

假设1:如果大鼠使用状态推断策略,它们在遇到明确指示状态改变的“不一致试验”(incongruent trials)后,行为和神经表征应发生突变,而非渐进式调整 。

假设2:OFC对于计算或更新主观信念(subjective beliefs)是必要的;如果OFC失活,动物将无法有效更新先验信念,从而退化为依赖近期奖励历史的简单策略 。

假设3:不同训练阶段的大鼠使用不同策略(初学者用除法归一化,专家用推断),这种差异应反映在OFC的潜变量神经动力学中 。

图7

核心发现

发现一:专家大鼠通过状态推断指导决策,

而非简单的强化学习

专家大鼠利用贝叶斯推断策略在隐蔽状态间灵活切换,表现为在接收到关键证据后立即更新行为策略。为了弄清大鼠究竟是像“侦探”一样推断环境状态,还是像“条件反射”一样被动适应奖励,作者设计了一套精巧的分析逻辑。他们将目光锁定在一种特殊的“不一致试验”(Incongruent Trial)上,这是指在当前Block中出现了一个此前绝对不可能出现的奖励(例如在低奖励Block中突然出现了高额奖励),这一单一事件就足以明确指示环境状态已经改变。作者分析了349只专家大鼠在遭遇这种试验前后的“等待时间”数据,这是一种衡量大鼠主观价值预期的行为指标。结果显示,在遇到不一致试验之前,大鼠的等待时间还停留在旧Block的水平;但在该试验之后,无论之前的历史如何,大鼠对同一奖励(如20µL)的等待时间会发生瞬间跳变,并迅速收敛到一个新的稳定值,这与Figure 1F所展示的曲线完美吻合。这种行为模式不能被传统的渐进式强化学习模型解释,但却能被一个基于贝叶斯规则的“推断模型”精确拟合。这一发现确立了本研究的基石:训练有素的大鼠确实构建了环境的认知模型,并据此进行快速的信念更新。

图8

Figure 1. Behavioral evidence for state inference

发现二:OFC失活损害了关于状态的信念更新

OFC的功能对于更新关于隐蔽状态的主观信念至关重要,其失活会导致先验信念变得“粘滞”而难以改变。在确认了行为策略后,作者通过药理学手段探究了OFC的因果作用。他们在大鼠双侧外侧眶额叶皮层(LO)注射Muscimol(一种GABA激动剂)以暂时抑制神经活动,并对比了同一只大鼠在控制条件和失活条件下的表现。行为数据显示,OFC失活并没有破坏大鼠对当前奖励价值的基本判断(即想要大奖的动机未变),但显著削弱了它们对隐蔽Block变化的敏感度。具体而言,如Figure 2C所示,在状态转换发生后,失活组大鼠调整等待时间的速度明显变慢,呈现出一种迟缓的过渡,而非专家大鼠那样的快速适应。为了理解这一现象背后的计算缺陷,作者将行为数据代入贝叶斯推断模型进行拟合,发现这种行为损伤在数学上等同于增加了模型的“流失率”(Lapse Rate)。这意味着,OFC失活后,大鼠在每次试验中“未能更新先验信念”的概率大大增加,导致旧的信念一直顽固地保留着(Sticky Priors)。这一结果有力地证明,OFC的核心功能并非简单的价值存储,而是负责在面对新证据时主动更新对环境状态的信念。

图9

Figure 2. OFC supports belief updating for state inference

发现三:OFC单个神经元活动反映了推断出

的状态转换

OFC神经元对相同奖励的反应取决于大鼠推断出的当前状态,并在关键证据出现后迅速重置。为了寻找支持上述认知过程的神经基础,作者使用Neuropixels探针记录了清醒大鼠OFC中的大量单个神经元活动。分析的核心逻辑依然围绕“不一致试验”展开:如果在物理刺激完全相同(例如都是20µL水)的情况下,神经元的反应不同,那么这种差异必然源于大鼠内在信念的不同。数据显示,在不一致试验发生前,OFC神经元对20µL奖励的放电率会根据大鼠认为自己处于“高奖励Block”还是“低奖励Block”而表现出显著差异;然而,一旦不一致试验揭示了真实状态(即进入了混合Block),这种差异在随后的20µL试验中瞬间消失,放电率“坍缩”(Collapse)到同一水平。Figure 3D生动地展示了这一现象:在不一致试验前,代表两种信念的神经活动曲线分离明显;在不一致试验后,两条曲线迅速重合。这种对推断状态的特异性编码是OFC独有的,因为作者在同时记录的运动皮层(M1)和视觉皮层(V2)中并未发现类似的快速重置现象,这表明OFC是处理这种抽象认知推断的关键枢纽。

图10

Figure 3. Single neurons in OFC reflect inferred states

图11

Figure 4. Inferred state transitions are distributed across clusters of neurons

发现四:潜在神经动力学(Latent Dynamics)揭示了信念的突变

通过无监督模型提取的神经群体慢速潜变量,直接描绘了大脑内部信念更新的动态轨迹。鉴于单个神经元的反应可能嘈杂且异质,作者采用了一种名为“分层潜变量动力学系统”(hLDS)的先进统计模型,从高维的神经群体活动中提取低维的潜变量(Latent Factors)。该模型假设神经活动由两部分驱动:一是通过试验间缓慢变化的“慢速变量”($z_k$),二是在试验内快速变化的“快速变量”。令人惊讶的是,尽管模型在训练时完全不知道任务的外部信息(如Block何时切换),提取出的慢速变量$z_k$却自发地追踪了隐蔽的奖励状态。如Figure 5F所示,当我们将这个潜变量对齐到“不一致试验”时,可以清晰地看到它在试验前处于分离状态(对应旧的高/低状态信念),而在不一致试验发生的瞬间或紧随其后,它经历了一个急剧的跳变,迅速收敛到新的数值。这种神经动力学的突变与行为层面的顿悟完全同步,从群体编码的角度直观地展示了“信念更新”这一抽象心理过程在大脑中的物理实现。

图12

Figure 5. Latent factors reflect inference

发现五:初学大鼠使用“除法归一化”策略,

而非推断

在学习初期,大鼠尚未形成环境结构模型,而是依赖基于历史奖励总和的简单除法计算来调整价值。为了探究这种复杂的推断能力是如何习得的,作者回顾了训练早期(前15个疗程)的行为数据。与专家大鼠不同,初学大鼠在面对状态转换时,行为调整显得平滑而滞后,且受到长时程奖励历史的显著影响。作者引入了“除法归一化”(Divisive Normalization)模型——一种在感知觉领域常见的计算机制,即当前价值被过去一系列奖励的总和所除。模拟结果显示,该模型能完美复现初学大鼠的行为特征,包括在Figure 6F中展示的渐进式过渡,以及在Figure 6H中显示的即使在不一致试验后仍存在的历史依赖性。与之对应的是,在初学大鼠的OFC神经记录中,hLDS模型提取出的慢速潜变量并不具备专家大鼠那种清晰的状态编码特征,而是与具体的奖励历史强相关。这表明,随着训练的深入,大脑从一种通用的、基于统计的适应策略(除法归一化),转变为一种特定的、基于认知模型的推断策略,OFC的神经计算模式也随之发生了根本性的重组。

图13

Figure 6. Rats use distinct strategies early in training

图14

相关阅读

周报-20251006 | 近两周解读的29篇顶刊论文汇总 | 认知神经科学前沿动态 ⭐️[解读链接]

周报-20250922 |认知神经科学前沿动态周览 *⭐️[解读链接]***

周报-20251020|认知神经科学前沿动态周览**⭐️[ 解读链接 ]****

Nature |决策过程的动力学机制与神经模式转变 ⭐️[解读链接]

Nature |颠覆认知 ! “神经振荡”不成立?耶鲁团队提出大脑“伽马事件”新理论  ⭐️[解读链接]

Science |中国将领衔未来25年全球脑计划,剑指灵长类大脑地图  *⭐️[解读链接]***

Neuron |大脑如何区分现实与想象?伦敦大学学院团队最新研究揭秘“现实信号”的神经密码 ⭐️[解读链接]

Nature | 视觉系统新发现:压缩式的物体识别机制 ⭐️[解读链接]

Nat Hum Behav|你不是天生就爱跟风:社会特征学习理论揭示人类“随大流”背后的秘密  *⭐️[解读链接]***

Nature |“读心术”成真?从瞳孔变化中解码大脑皮层完整时空动态 ⭐️[解读链接]

PNAS|刷短视频停不下来?研究揭示“新奇感”是驱动人类探索的古老密码 *⭐️[解读链接]***

Neuron | 最强脑发育数据库RBC开放下载,6000+青少年大脑数据揭示精神健康的秘密 ⭐️[解读链接]

Nature 子刊综述|大脑预测误差的核心回路 *⭐️[解读链接]***

前沿交流 | 欢迎加入认知神经科学前沿交流群!⭐️[解读链接]

图15

核心图表、方法细节、统计结果与讨论见原文及其拓展数据。

分享人:天天

审核:PsyBrain 脑心前沿编辑部

图16

PsyBrain 脑心前沿

带你了解心理学、脑科学的前沿知识与技术流程

预览时标签不可点

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图17

微信扫一扫可打开此内容,
使用完整服务

返回板块首页