🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / 决策与强化学习:顶刊文献解读专题 / A · 文献解读 / A081 · Neuron哈佛研究者让小鼠玩VR,揭示了大脑决策的“内

A081 Neuron | 哈佛研究者让小鼠玩VR,揭示了大脑决策的“内置算法”

来源:公众号 PSY-Brain_Frontier | 发布:2025-10-09 | 原文链接

PsyBrain 脑心前沿 | 公众号 PSY-Brain_Frontier

一键关注,点亮星标 ⭐️

不错过每日前沿资讯

认知神经科学前沿文献分享

图1

基本信息:

Title:Competitive integration of time and reward explains value-sensitive foraging decisions and frontal cortex ramping dynamics

发表时间:2025.8.7

Journal:Neuron

影响因子:14.9

获取原文:

  1. 后台回复“文献”即可获取PDF版本
  2. 点击页面底部“阅读原文”即可跳转论文原网页

图2

图3

引言

想象一下,你面前放着一大盘炸薯条,香气扑鼻。一开始,你总能轻松地拿到又长又脆的完美薯条。但渐渐地,盘子里只剩下一些碎屑和短小的薯条。这时,一个“灵魂拷问”出现了:是继续在盘子里费劲地翻找剩下的小薯条,还是干脆地放弃,再去点一盘新的?

你的这个决定其实很复杂。它可能取决于:

你大脑里正在进行的,就是一场关于“收益”与“成本”的持续拉锯战。这篇科学论文研究的,正是动物世界里版本完全相同的“吃薯条问题”。科学家称之为“觅食决策”。无论是小鸟在寻找浆果,还是蜜蜂在花丛中采蜜,它们无时无刻不在做着“留下还是离开”的决定。

过去,科学家们认为动物的决策应该遵循一个“最优数学公式”(即边际价值理论),就像一个完美的经济学家。但现实中,动物们的表现常常“不那么完美”。那么,它们的大脑里到底发生了什么呢?这篇文章的科学家们就设计了一个给小鼠玩的“虚拟现实觅食游戏”来回答这个问题。

图4

省流总结

这篇论文研究动物在觅食决策中的“何时离开”问题。作者首先通过一个虚拟现实觅食任务,发现小鼠的决策行为虽然与经典的“边际价值理论”(MVT)定性相符,但在定量上存在系统性偏差。为解释这种偏差,作者提出并验证了一系列整合模型(Integrator Models),发现一种“竞争性整合模型”(即时间累积的离开倾向与奖励获得的留下倾向相互竞争)能最好地解释小鼠行为,特别是当该模型由一个缓慢变化的内在“耐心”状态进行缩放时。通过在小鼠前额叶皮层进行大规模神经记录,作者发现该区域的神经元活动呈现出一种“斜坡式”(ramping)动态,即放电率随时间累积而上升,并被奖励抑制,这与竞争性整合模型中的决策变量高度一致。这项工作揭示了前额叶皮层通过斜坡式动态来整合时间与奖励信息,是指导价值敏感性觅食决策的一个潜在神经机制。

图5

研究动机与背景

该研究的背景是动物行为学和决策神经科学中的一个经典问题:觅食(foraging)。动物在资源呈斑块状分布的环境中,必须不断决定何时离开当前逐渐枯竭的资源点(patch)去寻找下一个。经典的边际价值理论(MVT)为该问题提供了规范性的最优解:当资源点的瞬时回报率下降到环境的平均回报率时,就应该离开。尽管许多行为观察在定性上支持MVT,但动物的行为常常与之存在偏差,并且MVT本身只描述了“最优”策略,并未揭示实现这一决策的生物学过程和算法机制。前人研究已表明前额叶皮层在觅食决策中扮演重要角色,但其如何具体通过神经活动来权衡时间成本与奖励收益,从而决定离开时机,这一机制仍不清楚。因此,作者试图解决的关键科学问题是:在价值敏感性的觅食决策中,大脑究竟采用何种计算算法,以及该算法的神经基础是什么?

图6

实验设计与方法逻辑

为解决上述核心问题,作者设计了一套环环相扣的研究方案。首先,他们开发了一个精巧的虚拟现实觅食任务,让头部固定的小鼠在虚拟环境中“跑动”以寻找和停留在奖励“斑块”上。这种范式巧妙地平衡了生态相关性与实验可控性,允许研究者精确操控奖励的大小和频率,从而系统性地量化小鼠的停留时间(PRT)并将其与MVT的预测进行严格比对。在发现小鼠行为与MVT存在系统性偏差后,研究者没有简单地修正MVT,而是转向探索过程层面的解释,提出并比较了三种不同的“整合模型”,这些模型假设决策是通过一个内部决策变量(DV)的动态演化实现的。通过复杂的计算建模与行为数据拟合,他们筛选出最能解释行为数据的“竞争性整合模型”,并发现引入一个描述动物内在“耐心”的缓慢变化状态变量能极大提升模型的预测能力。为了探究这一算法的神经实现,作者利用高通量Neuropixels探针技术,在小鼠执行任务时,同步记录了其前额叶皮层及皮层下区域大量神经元的活动。最后,他们将行为模型与神经数据相结合,通过解码分析检验神经群体活动是否能够表征模型中的关键决策变量,并深入分析了这些神经信号(如斜坡动态、对奖励的响应)的特性,从而验证了前额叶皮层的斜坡式动态是实现竞争性整合决策过程的有力神经候选机制。

图7

核心发现

发现一:小鼠觅食行为系统性地偏离了最优觅食理论(MVT)的预测

尽管小鼠在更富裕的资源点停留时间更长,这与MVT的定性预测一致,但其行为在定量上违背了MVT的两个核心预测。首先,MVT预测动物离开时所有资源点的瞬时回报率应是相同的,但数据显示小鼠离开高价值资源点时回报率偏高(走得太早),离开低价值资源点时回报率偏低(走得太晚)。其次,任务设计使得MVT预测不同奖励大小的资源点之间的停留时间差异应为常数,但小鼠的行为显示这种差异随其整体“耐心”程度而变化。Figure 3A清晰展示了在不同类型的资源点,小鼠离开时的瞬时回报率并非一个恒定值,这直接违背了MVT的核心预测。Figure 3C则显示了4µL和2µL奖励的停留时间差显著大于2µL和1µL奖励的停留时间差,违背了MVT在该实验设计下的等差预测。

发现二:一种考虑了“耐心”状态的竞争性整合模型(Model 3)能精准解释小鼠行为

作者比较了三种整合模型,其中模型3(决策变量随时间累积,但被每次奖励抵消一部分)在贝叶斯信息准则(BIC)评估中表现最佳。该模型不仅能解释小鼠对奖励频率的敏感性,还能解释其对奖励历史的记忆效应(例如,在“RRR”序列中比在“ROR”序列中等待更久),这是其他模型无法做到的。尤为关键的是,当模型的参数根据一个从行为中提取的、缓慢变化的“耐心”状态进行缩放时,能极好地预测单次试验的停留时间,并解释个体间和个体内的行为变异。Figure 3G展示了模型3的BIC值显著低于其他模型,证明其是解释行为数据的最优模型。Figure 3I通过对比“RRR”和“ROR”两种特殊奖励序列下的停留时间,展示了小鼠的行为(右图)与模型3的预测(中图)一致,都表现出对额外奖励(位于t=1s)的记忆,而模型2则不能。

图8

Figure 3. Competitive integration processes explain foraging behavior

发现三:前额叶皮层神经元普遍存在被奖励抑制的“斜坡式”活动

通过大规模神经记录,研究者发现前额叶皮层的许多神经元在小鼠停留在资源点期间,其放电率会随着时间逐渐升高或降低,形成一种“斜坡”(ramping)动态。当奖励出现时,这种斜坡趋势会被暂时性地抑制或重置,其方向与斜坡方向相反。这种“时间累积、奖励抑制”的活动模式在单个神经元层面和群体活动的主成分(PCs)中都非常普遍,并且在前额叶皮层中比在皮层下区域更为显著。Figure 4C是一个典型的例子,展示了单个神经元(来自OFC)的活动在没有奖励时随时间爬升,但在t=1s处获得奖励时(红线),其活动会受到明显抑制。Figure 4G则从整体上证明了这种神经活动与模型3决策变量的关联度在前额叶皮层区域(Frontal Cortex)显著高于皮层下区域(Subcortical Areas)。

图9

Figure 4. Reward-suppressed ramps are prevalent in the frontal cortex

发现四:神经群体活动编码了一个具有部分重置和历史记忆的决策变量

解码分析表明,尽管模型3最能解释行为,但从神经群体活动中可以解码出所有三个模型的决策变量。然而,这个解码出的“神经决策变量”展现出独特的混合特性:它在奖励后并非完全重置(不同于模型2),而是部分重置;同时,它能保留最近一次奖励之前的奖励历史信息(这是模型3的关键特征)。这表明,大脑中主导的神经信号并不完全等同于任何一个理想化的模型,而是更接近于一个能够整合多方面信息、并保留记忆的动态过程。Figure 5L展示了奖励事件对解码出的神经信号的影响斜率约为-0.5,介于模型3的0(无重置)和模型2的-1(完全重置)之间,揭示了“部分重置”的特性。Figure 5P则是一个关键证据,显示解码出的神经信号在t=2s时的值,在“RRR”序列中系统性地低于“ROR”序列,证明神经活动保留了t=1s时奖励的历史痕迹,这与模型3和小鼠的行为一致。

图10

Figure 5. DV decoder output shares features of models 2 and 3

图11

Author information

第一作者兼通讯作者:Michael Bukwich

Department of Molecular and Cellular Biology, Harvard University, Cambridge, MA 02138, USA; Center for Brain Science, Harvard University, Cambridge, MA 02138, USA

哈佛大学分子与细胞生物学系及脑科学中心

Sainsbury Wellcome Centre, University College London, London W1T 4JG, UK

伦敦大学学院Sainsbury Wellcome中心,

共一第二兼通讯作者:Malcolm G. Campbell

最后署名 & Lead contact:Naoshige Uchida

图12

Abstract

Patch foraging is a ubiquitous decision-making process in which animals decide when to abandon a resource patch of diminishing value to pursue an alternative. We developed a virtual foraging task in which mouse behavior varied systematically with patch value. Behavior could be explained by models integrating time and rewards antagonistically, scaled by a slowly varying latent patience state. Describing a mechanism rather than a normative prescription, these models quantitatively captured deviations from optimal foraging theory. Neuropixels recordings throughout frontal areas revealed distributed ramping signals, concentrated in the frontal cortex, from which multiple integrator models’ decision variables could be decoded equally well. These signals reflected key aspects of decision models: they ramped gradually, responded oppositely to time and rewards, were sensitive to patch richness, and retained memory of reward history. Together, these results identify integration via frontal cortex ramping dynamics as a candidate mechanism for solving patch-foraging problems.

图13

本文解读基于:Competitive integration of time and reward explains value-sensitive foraging decisions and frontal cortex ramping dynamics,Doi:10.1016/j.neuron.2025.07.008。核心图表、方法细节、统计结果与讨论见原文及其拓展数据。

分享人:天天

审核:PsyBrain 脑心前沿编辑部

图14

PsyBrain 脑心前沿

带你了解心理学、脑科学的前沿知识与技术流程

预览时标签不可点

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图15

微信扫一扫可打开此内容,
使用完整服务

返回板块首页