A067 PNAS | 老鼠遵循理性原则在“生存与娱乐”间做出最优决策
来源:公众号 PSY-Brain_Frontier | 发布:2025-11-12 | 原文链接
PsyBrain 脑心前沿 | 公众号 PSY-Brain_Frontier
一键关注,点亮星标 ⭐️
不错过每日前沿资讯
认知神经科学前沿文献分享

基本信息:
Title:Rats pursue food and leisure following the same rational principles
发表时间:2025.10.30
Journal: PNAS
影响因子:9.1
获取原文:
- 后台回复“文献”即可获取PDF版本
- 点击页面底部“阅读原文”即可跳转论文原网页


引言
我们经常把动物实验中的“动机”简单等同于“为了吃”。从经典的斯金纳箱(Skinner box)到各种强化学习(Reinforcement Learning, RL)范式,动物被训练去按压杠杆或鼻触以换取食物或水。这套框架帮助我们理解了很多关于学习、奖励和决策的基本机制,但它也把真实世界的复杂性“折叠”了:野外动物并不只为一种目标奔忙,它们一边找食物,一边要避敌、繁殖、育幼,甚至在安全与食物充足时还会“玩耍”(play)和“休闲”(leisure)。当多个目标同时竞争有限的时间与精力时,动物如何在它们之间做权衡?这是理解多目标优化(multiobjective optimization)与自然情境下决策的关键问题。该论文正是把这道题从“单目标箱庭”搬回到“多目标生态位”,并以老鼠为对象给出漂亮的行为学证据。

作者构建了一个更“生态化”的自由选择“斑块—离开(patch-leaving)”任务(foraging patch task)。在一个三舱装置中,老鼠可以在“食物斑块”(food patch)里按递减速率获得蔗糖颗粒(sucrose pellets),也可以去“玩具斑块”(toy patch)与一个小型“鼠类游乐场”互动,但在那里不会获得食物。两种斑块位于不同区域,中间由“旅行走廊”连接,研究者通过设置“旅行时间”(travel time)来操控在两斑块间切换的机会成本(opportunity cost):旅行时间越长,切换成本越高,动物就越应该在当前斑块待得更久——这正是最优觅食理论(optimal foraging theory)的经典预言。

这项工作抓住了一个常被忽略但极具现实意义的问题:非营养性强化(nonfood reinforcer)——比如玩耍、探索、社交——是否与食物一样,遵从同一套“理性”法则?具体说,当机会成本变高时,老鼠是否也会在“玩耍斑块”里逗留更久、延后切换?如果答案是肯定的,那么这说明在多种“货币”(多种效用来源)并存的情况下,动物的大脑也许以统一的代价—收益计算来分配时间预算。
这一想法不仅能连接生态学中的觅食模型与神经科学中的决策回路,还为解释经典任务中常见的“过度停留(overharvesting)”等偏差提供新的角度:也许动物在“只给食物”的任务里仍在追求其它非显式奖励,从而导致看似“非最优”的停留行为。

论文给出的结论简明有力:老鼠在食物与玩耍之间分配时间时,同样体现了对机会成本的敏感——旅行时间越长,它们在食物斑块和玩具斑块停留的时间都更长;此外,它们即便“为吃而饿”,仍愿意牺牲本可获得的食物去玩耍,显示非食物强化具有可观的内在价值(intrinsic value)。更妙的是,作者还通过时间动态与饱腹/预暴露操控,表明这种分配并非僵化习惯,而是目标导向、可随内部状态与近期消费调整的“理性”选择。这一整套证据,把“玩耍不是无用之举”的直觉,变成了可量化、可建模的行为规律。

省流总结
背景:传统实验多以“单一食物奖励”研究决策;现实中动物需在多目标间做时间/精力分配。
核心设计:自由选择斑块任务——食物斑块(递减投喂速率)vs. 玩具斑块(可玩耍,无食物),操控“旅行时间”以改变切换机会成本。
主要发现:机会成本高→两类斑块的停留时间都变长;老鼠愿为玩耍付出显著“食物机会成本”;早期更偏好玩具,后期转向食物;预暴露导致对相应斑块停留时间缩短,表明目标导向与状态依赖性。
意义:食物与休闲可由同一“理性原则”统摄;为神经经济学、RL与生态学的交叉提供自然化范式,并为解释“过度停留”等现象提供新思路。

研究背景
现实世界中的动物面对并行、多变的目标:觅食、避敌、求偶、育幼与休息等。实验室范式往往用单一奖励去考察“最优化”,难以揭示动物如何在多目标之间动态权衡。该研究引入“斑块”视角:在有限时长的会话中,个体反复做出“去哪儿?待多久?何时切换?”的序列决策,这天然适合用机会成本与边际价值(marginal value)来刻画。经典觅食理论强调“错失机会的代价”:选择某一行动意味着放弃其他可能的奖励来源——因此,切换成本(如旅行时间)应系统性地影响停留时长。作者把这一框架扩展到非营养性强化,测试“玩耍/休闲”的时间分配是否也服从相同法则。若成立,将指向一种跨目标的统一理性策略,并提示在传统只给食物的任务中,动物可能仍从“非食物行为机会”中获取效用,进而解释“过度停留”等长期困扰模型与数据匹配的问题。
与此同时,作者意识到“玩耍斑块”的吸引力可能被误解为“探索食物”的副产物。为此,他们在第二组实验中设置“玩具 vs. 空斑块”,并让动物在家笼中不缺食(ad libitum)、且在装置中永不遇到食物,以最小化“找吃的”动机与期待,从而检验玩耍本身的效用。进一步,通过预暴露/饱足操控(会前先给食或先给玩具),观察动物是否根据近期消费与内部需求调整停留时间,以区分“目标导向”与“僵化习惯”。

实验设计
研究使用三舱装置:两侧为“斑块”场地,中间为“旅行走廊”,自动门确保每次切换必须经历固定时长旅行延迟(10秒或60秒),从而可控地改变切换机会成本。
食物斑块中以递减速率投放蔗糖颗粒(进入时速率最高,随停留时间指数衰减;再次进入则重置),
玩具斑块中央放置“鼠类游乐场”(攀爬/可操作物体),不提供食物。
第一组(10只,限食)在“食物 vs. 玩具”“食物 vs. 食物”“玩具 vs. 玩具”等条件与两种旅行时间全交叉的会话中自由选择并反复切换;第二组(6只,不限食)在“玩具 vs. 空斑块”与“玩具 vs. 食物”(配合会前预暴露食或玩具)条件下测试。行为数据以线性/广义线性混合效应模型分析,因变量包括访问次数与单次停留时长;同时计算“在斑块中心区域的时间与速度”作为玩具互动的代理指标;机会成本以“若把玩具停留时间全部改投食物斑块,理论上能多赚到的颗粒数”估计(基于对食物斑块投喂过程的蒙特卡洛模拟)。

Fig. 1. The free-choice foraging task.

核心发现
发现一|切换成本抬升,两类斑块同向延长停留——“理性”不分食物与玩耍
在操纵旅行时间为长(60s)时,老鼠在食物斑块与玩具斑块的平均停留时长均显著增加,访问次数相应减少。这与最优觅食理论一致:切换越贵,越要“吃干榨净”后再离开;关键在于这种规律对玩耍同样成立,表明动物在分配“工作(觅食)/休闲(玩耍)”的时间时使用一样的机会成本计算。作者的摘要与结果部分明确指出:“当切换代价更高时,老鼠在两类斑块里都待得更久;表明相似的理性原则同时支配了食物与非食物奖励的追求”。这将“玩耍”纳入统一的理性选择框架。
图示要点(Fig.2):长旅行时间条件下,柱状图显示两类斑块的单次停留时间上移,访问次数下移;把握主信息:机会成本↑ → 停留↑、切换↓(食物与玩具一致)。

Fig. 2. Behavioral results.
发现二|“玩耍很贵”,但老鼠仍愿意为其买单——可量化的内在价值
作者用“Foregone food(错失食物)”来给玩具斑块定价:把动物在玩具斑块花掉的每段时间,带入食物斑块的投喂时序模型,估算“本可多赚的颗粒数”。结果显示,老鼠的实际获得食物与若全投食物斑块的潜在食物数量相近——换言之,它们为了玩耍,放弃了大致一半的可得食物,玩耍的代价很高,但老鼠依然选择为其付费,体现出非食物奖励的可观效用。正文明确写道:“老鼠若完全不去玩具斑块,可以把食物收益翻倍”。这一下将“玩耍的价值”从直觉拉到“账本”上。
图示要点(Fig.3E):并列柱表示“实际赚到的食物”与“把玩具时间改投食物的可得食物”相近。关注要点:玩耍=高机会成本,但动物仍作此选择,显示内在价值。

Fig. 3. Rats engaged with the play structure, and visits to toy patches were costly.
发现三|时间动态:先玩后吃的策略切换
直觉上,限食的老鼠应当“先吃后玩”。但时间轨迹分析显示恰好相反:会话早期,老鼠更偏爱玩具斑块;到会话后段才将时间分配逐步转向食物斑块。定量指标如达到累计100秒、300秒停留所需的延迟在玩具斑块更短,500秒时两者差异消失——意味着前期“玩耍超前”,后期“食物追平并反超”。这提示动物可能在会话开始时先满足探索/玩耍的动机,随后再把重心放到能量补给上,体现灵活的目标优先级排序。
图示要点(Fig.4A-B):累计停留曲线与到达阈值的延迟对比。主信息:早期玩具优先,后期食物占优。

Fig. 4. Temporal dynamics of food and toy-patch visits.
发现四|玩具互动并非“找吃的”的副产品
如果老鼠只是“以为玩具处可能突然出食物”,那玩耍偏好可能是探索食物的假象。为此,第二组实验让动物家笼不缺食,且装置中永远无食物,只在“玩具 vs. 空斑块”条件下选择。结果老鼠对玩具的偏好反而更强:访问次数更多、停留更久,直接证明玩耍本身具有吸引力。此外,中心区域的停留与速度也支持“互动玩耍”解释:玩具斑块中心停留比例更高、移动速度更慢——是“驻足玩耍”,不是“穿越找吃的”。
图示要点(Fig.3C-D;Fig.5A-B):中心占据率↑、中心速度↓(玩具>食物);玩具相对空斑块的访问次数与停留时长均↑。关注:玩具的独立强化价值。

Fig. 5. Motivational manipulations.
发现五|预暴露操控:时间分配随近期消费
与需要而变
若是目标导向体制,近期对某种奖励的预暴露/部分饱足应降低对该奖励的边际价值,从而减少相应斑块的停留时长。结果符合预期:会前先吃糖→随后对食物斑块停留更短;会前先玩→随后对玩具斑块停留更短;但访问频率并未显著改变,说明动物仍维持对两种斑块的采样(探索),只是把更长的停留时间投向“会前未获得”的那一方——这是探索-利用平衡的精巧体现:频率层面维持探索,时长层面倾向利用当前稀缺的目标。
图示要点(Fig.5C-D):停留时长对预暴露身份呈选择性下降,访问次数不变。关注:状态依赖的目标导向。

结论
总体评价:本文以自然化的自由选择—斑块范式,将“工作/吃饭”与“休闲/玩耍”置于同一理性框架下检验,显示机会成本统一调节两类行为的时间分配;老鼠愿为玩耍支付高昂“食物机会成本”,且这种权衡随内部状态与近期消费动态调整。研究将生态学的最优觅食理论与神经经济学/强化学习的多目标优化紧密对接,为理解实验中“过度停留”等现象提供新解释框架。

展望与应用
多货币(multi-currency)建模:如何在统一价值函数中同时编码食物与玩耍等非营养性效用,并与“机会成本/旅行时间”相结合,得到可预测的时间分配策略?(可在RL中引入多目标标量化或向量化价值)。
参数化操控奖励速率:系统升/降食物斑块的投喂速率,是否能连续地推动时间分配向食物或玩具倾斜?模型与数据能否精准对齐?
神经机制定位:在前额叶/纹状体/多巴胺系统中,是否存在统一编码“时间机会成本”的通道,对食物与玩耍均起调控作用?
泛化到其它非食物奖励:社交、探索新奇、触觉/环境丰富度等是否同样服从统一法则?可用同一范式拓展验证。
解释“过度停留”:在只给食物的任务中加入可控的“非食物行为机会”,能否系统性地减少/调节“过度停留”,从而验证本文提出的机制性解释?

文章作者信息
第一作者:Raegan S. Logue
Department of Psychology, University of California, Los Angeles(UCLA,加利福尼亚大学洛杉矶分校,心理学系)。
通讯作者:Andrew M. Wikenheiser
同上;
期刊与时间:PNAS(Proceedings of the National Academy of Sciences),发表于 2025年10月30日;文章为CC BY-NC-ND 4.0许可。

Abstract
Animals in the wild must balance multiple, potentially mutually exclusive goals simultaneously in order to survive. Yet laboratory tests of decision-making often investigate how animals optimize their behavior to achieve a single, well-defined goal, which is often a nutritive reward. Thus, how animals solve multiobjective optimization problems is not well understood. Here, we devised an ethologically inspired decision-making task to examine how rats balance the pursuit of food and nonfood reinforcement. Rats performed a free-choice patch-foraging task, in which they could earn food in one location (food patch) or interact with a rodent play structure in a different location (toy patch). The cost of switching between patches was manipulated by requiring rats to endure a long or short “travel time” penalty during which they were not able to access either patch. Rats devoted a considerable amount of their limited foraging time to patches of both types, showing a small but significant preference for food patches. In accordance with theoretical models of foraging, when the cost of switching patches was high rats chose longer stay durations in both types of patches, suggesting that similar rational principles guided their pursuit of food and nonfood rewards. Examining the within-session dynamics of time allocation revealed that rats showed an early preference for spending time in toy patches that reversed over the course of the session. Satiety manipulations demonstrated that patch residence time decisions were under goal-directed control and responsive to current needs and recent consumption.

相关阅读
周报-20251006 | 近两周解读的29篇顶刊论文汇总 | 认知神经科学前沿动态 ⭐️[解读链接]
周报-20250922 |认知神经科学前沿动态周览 *⭐️[解读链接]***
周报-20251020|认知神经科学前沿动态周览**⭐️[ 解读链接 ]****
Nature |决策过程的动力学机制与神经模式转变 ⭐️[解读链接]
Nature |颠覆认知 ! “神经振荡”不成立?耶鲁团队提出大脑“伽马事件”新理论 ⭐️[解读链接]
Science |中国将领衔未来25年全球脑计划,剑指灵长类大脑地图 *⭐️[解读链接]***
Neuron |大脑如何区分现实与想象?伦敦大学学院团队最新研究揭秘“现实信号”的神经密码 ⭐️[解读链接]
Nature | 视觉系统新发现:压缩式的物体识别机制 ⭐️[解读链接]
Nat Hum Behav|你不是天生就爱跟风:社会特征学习理论揭示人类“随大流”背后的秘密 *⭐️[解读链接]***
Nature |“读心术”成真?从瞳孔变化中解码大脑皮层完整时空动态 ⭐️[解读链接]
PNAS|刷短视频停不下来?研究揭示“新奇感”是驱动人类探索的古老密码 *⭐️[解读链接]***
Neuron | 最强脑发育数据库RBC开放下载,6000+青少年大脑数据揭示精神健康的秘密 ⭐️[解读链接]
Nature 子刊综述|大脑预测误差的核心回路 *⭐️[解读链接]***
前沿交流 | 欢迎加入认知神经科学前沿交流群!⭐️[解读链接]

核心图表、方法细节、统计结果与讨论见原文及其拓展数据。
分享人:BQ
审核:PsyBrain 脑心前沿编辑部

PsyBrain 脑心前沿
带你了解心理学、脑科学的前沿知识与技术流程
预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务