M070 Neuron最新 | 规划未来还是构建地图?普林斯顿团队提出统一海马“重放”功能的新理论
来源:公众号 PSY-Brain_Frontier | 发布:2025-10-30 | 原文链接
PsyBrain 脑心前沿 | 公众号 PSY-Brain_Frontier
一键关注,点亮星标 ⭐️
不错过每日前沿资讯
认知神经科学前沿文献分享

基本信息
Title:Between planning and map building: Prioritizing replay when future goals are uncertain
发表时间:2025.10.27
Journal:Neuron
影响因子:15.0
获取原文:
- 后台回复“文献”即可获取PDF版本
- 点击页面底部“阅读原文”即可跳转论文原网页



研究背景
想象一下,你每天通勤的地铁站突然关闭了,你需要立刻规划出一条新的最佳路线。或者,你常去的咖啡馆换了老板,不再卖你最爱的拿铁。在这些情境中,我们的大脑展现出惊人的灵活性,迅速调整行为策略。这种能力背后,一个名为“海马重放”(hippocampal replay)的神经机制扮演着至关重要的角色。

在休息或睡眠时,我们大脑中的海马体会像快进或倒带一样,以压缩的形式重新激活过去经历的神经活动序列。长期以来,科学家们对这一现象的计算功能争论不休,形成了两大主流观点 :
- “价值假说” (Value Hypothesis):该观点认为,重放是一种服务于当前目标的在线规划 (planning)。就像GPS为你计算到达目的地的最短路径一样,重放通过模拟未来的可能性,来更新与决策相关的“价值”,从而指导我们做出最优选择。这一思想在Mattar与Daw于2018年提出的“优先重放”(prioritized replay)模型中得到了精准的数学刻画 。
- “地图假说” (Map Hypothesis):该观点则主张,重放的主要功能是构建和维护一幅独立于当前目标的、通用的“认知地图” (cognitive map)。这幅地图描绘了环境的结构布局,使我们能够在目标改变时灵活应对,而不仅仅是为了眼前的奖励 。
然而,近期的实验发现让“价值假说”陷入了困境。在一些目标位置会周期性改变的任务中,科学家观察到了所谓的“悖论性重放” (paradoxical replay) 现象:当奖励点从A点转移到B点后,动物的行为会迅速适应,跑向新的B点;但与此同时,它们的海马体却更频繁地重放通往旧的A点的路径。这种重放内容与行为目标的“滞后” (lag) 现象,似乎直接反驳了重放是为了规划当前路线的观点 。
那么,海马重放究竟是在为眼前的目标“运筹帷幄”,还是在为不确定的未来“构建地图”?或者,这两种看似矛盾的功能背后,是否存在一个更深层次的统一理论?这正是普林斯顿大学Nathaniel D. Daw教授团队在Neuron上发表的最新研究试图回答的核心问题。

研究核心总结
这项研究通过扩展经典的强化学习(Reinforcement Learning, RL)框架,提出了一个精巧的计算模型,成功地统一了关于海马重放的“价值”与“地图”两大假说,并完美解释了“悖论性重放”等一系列看似矛盾的实验现象。
其核心贡献与发现可概括如下:
- 引入“大地测量表示”(Geodesic Representation, GR) 作为认知地图的数学形式
传统RL模型中的价值函数 (Q-table) 将环境结构与特定目标奖励绑定,一旦目标改变,就需要重新学习。新模型提出的GR则将二者解耦。GR可以被想象成一个由多层价值函数组成的“活页夹”,每一“页” G(s, a, g) 都编码了从任意状态-动作对 (s, a)到达某个潜在目标 g 的最优路径(即最短路径)。这叠“活页夹”本身就是一幅通用的、不依赖于当前奖励的认知地图。当真实目标改变时,智能体只需“翻到”对应的那一页来指导行为,无需重新计算,极大地提升了决策的灵活性。

Figure 1. The GR

Figure 2. The GR supports replay to multiple goals and respects environmental structure
- 泛化“优先重放”机制,将未来目标的不确定性纳入考量
模型认为,大脑选择重放哪些记忆,遵循的是最大化期望效用的原则。其关键创新在于,这个“期望”并非只针对当前目标,而是对所有潜在的未来目标进行加权平均。重放哪个记忆片段的优先级,取决于该次重放对于提升所有潜在路径的期望价值,这个价值由智能体对未来各个目标出现可能性的信念分布 P(g) 进行加权。公式可简化为:优先重放能最大化 E g~P(g) [Utilityg] 的记忆。

Figure 3. GR replay captures replay-behavior lag in Gillespie et al.
- 通过分离不同时间尺度的学习过程,解释“悖论性重放”
该模型的核心洞见在于,智能体需要学习和维护两套关于目标的表征,它们在不同的时间尺度上更新:
- 一套是快速学习的“行为价值” (Rbehav),它以高学习率追踪当前哪个目标有奖励,用于指导即时行为。
- 另一套是慢速学习的“重放引导价值” (Rreplay),它以低学习率整合长期的经验,估计环境中目标的整体统计分布 P(g),用于指导重放的优先级。正因为 Rreplay 的更新缓慢,它本质上是一个近期加权平均 (recency-weighted average)。因此,当目标刚从A点切换到B点时,旧目标A在慢速更新的 P(g) 中仍占有很高的权重,导致系统优先重放通往A的路径来维护这张“地图”的这部分内容。这就自然地解释了为什么重放内容会滞后于行为的快速转变。

Figure 4. GR replay captures replay-behavior lag in Carey et al.
- 统一不同任务中的重放模式
该模型不仅能解释目标切换任务中的“滞后”重放,也能解释在目标稳定、结构复杂的任务(如 Pfeiffer & Foster, 2013 的研究)中观察到的前瞻性、“规划式”重放。在后一种情况下,由于环境统计特性稳定且动物经验丰富,其学到的 P(g) 会准确地反映当前“家园”位置是未来最可能的目标,因此重放会集中于规划通往当前目标的路径。

Figure 5. GR replay is coupled to current navigational goals when prioritized under rapidly alternating goal dynamics
总而言之,这项工作精妙地指出,“为当前规划”和“为未来建图”并非两种相互排斥的重放功能,而是同一个优化原则在不同环境统计特性和目标不确定性下的不同体现。 海马重放是一个统一的、服务于未来决策的智能计算过程,它所“回味”的内容,深刻地反映了大脑对世界动态变化的统计学建模。这项研究不仅为理解记忆、学习与决策的神经机制提供了全新的理论框架,也为未来通过精准调控环境的统计特性来检验重放功能,指明了清晰的实验方向。

Figure 6. GR replay trades off future and current goals

Abstract
Despite many empirical results about hippocampal replay, its computational function remains controversial. The “value” hypothesis contends that replay plans routes to current goals, while the “map” hypothesis holds that replay builds an abstract environmental representation, distinct from immediate goals. Data appear to support either view, though the planning hypothesis is particularly challenged by recent observations of replay lagging, rather than leading, animals learning to reach current goals. However, differentiating these ideas is difficult due to a lack of formal specificity, especially about the map hypothesis. We address these gaps by extending a prominent theory of planning to include routes to future as well as current goals: effectively a map. Whether replay prefers current goals, like planning, or others, like maps, then depends on their estimated likelihood of future relevance. This account reconciles both views with one another and with much data, revealing a deep relationship between the seemingly distinct hypotheses.

推荐相关阅读
周报-20251020|认知神经科学前沿动态周览**⭐️[解读链接]****
周报-20251006 | 近两周解读的29篇顶刊论文汇总 | 认知神经科学前沿动态 ⭐️[解读链接]
周报-20250922 |认知神经科学前沿动态周览 *⭐️[解读链接]***
Nature |决策过程的动力学机制与神经模式转变 ⭐️[解读链接]
Nature |颠覆认知 ! “神经振荡”不成立?耶鲁团队提出大脑“伽马事件”新理论 ⭐️[解读链接]
Science |中国将领衔未来25年全球脑计划,剑指灵长类大脑地图 *⭐️[解读链接]***
Neuron |大脑如何区分现实与想象?伦敦大学学院团队最新研究揭秘“现实信号”的神经密码 ⭐️[解读链接]
Nature | 视觉系统新发现:压缩式的物体识别机制 ⭐️[解读链接]
Nat Hum Behav|你不是天生就爱跟风:社会特征学习理论揭示人类“随大流”背后的秘密 *⭐️[解读链接]***
Nature |“读心术”成真?从瞳孔变化中解码大脑皮层完整时空动态 ⭐️[解读链接]
PNAS|刷短视频停不下来?研究揭示“新奇感”是驱动人类探索的古老密码 *⭐️[解读链接]***
Neuron | 最强脑发育数据库RBC开放下载,6000+青少年大脑数据揭示精神健康的秘密 ⭐️[解读链接]
Nature 子刊综述|大脑预测误差的核心回路 *⭐️[解读链接]***
前沿交流 | 欢迎加入认知神经科学前沿交流群!⭐️[解读链接]

本文解读基于:Between planning and map building: Prioritizing replay when future goals are uncertain,Doi:10.1016/j.neuron.2025.09.021。核心图表、方法细节、统计结果与讨论见原文及其拓展数据。点击左下角 “阅读原文” 可跳转到论文源网站界面。
分享人:饭哥
审核:PsyBrain 脑心前沿编辑部

PsyBrain 脑心前沿
带你了解心理学、脑科学的前沿知识与技术流程
预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务