A083 PNAS | 刷短视频停不下来?研究揭示“新奇感”是驱动人类探索的古老密码
来源:公众号 PSY-Brain_Frontier | 发布:2025-10-01 | 原文链接

点击蓝字 关注我们 知晓前沿
决策与认知建模前沿文献分享

基本信息
Title:Novelty as a drive of human exploration in complex stochastic environments
发表时间:2025.9.25
Journal:PNAS
影响因子:9.1
获取原文:
- 后台回复“文献”即可获取PDF版本
- 点击页面底部“阅读原文”即可跳转论文原网页


引言:是什么驱动我们永不停歇的探索?
你是否有过这样的经历:本想睡前只刷五分钟短视频,却在“下一个更精彩”的期待中不知不觉度过了一两个小时?或者,在信息流的“无尽滚动”中,手指仿佛有了自己的意志,不断刷新着永远看不完的新鲜事,尽管其中绝大多数内容并无实际价值。这种现象,从社交媒体到新闻应用,已经成为现代数字生活的常态。
我们常常将这种行为归咎于自制力不足,但如果换一个角度思考:这是否揭示了人类心智中一种更深层次、更古老的机制?是什么驱使我们放弃明确的目标(比如充足的睡眠),而去探索一个充满不确定性、奖励稀疏的虚拟环境?正如一项新研究所提出的核心问题:“你是愿意花几秒钟完成一个有确定奖励的任务,还是愿意花半小时去探索一条未知的小径,即便它可能一无所获?”。
近期,发表于《美国国家科学院院刊》(PNAS)的一项研究,通过精巧的虚拟实验和强大的计算模型,为我们揭示了这一行为背后的认知驱动力。研究发现,这种看似“浪费时间”的探索行为,可能源于一种深刻的、甚至可以说是与生俱来的本能——对“新奇”(Novelty)的追求。这项研究不仅为我们理解人类的好奇心和探索行为提供了全新的视角,也为解释为何现代数字产品能如此轻易地“劫持”我们的注意力提供了有力的科学依据。研究表明,社交媒体上的用户行为在质量和数量上都符合奖励学习的原则,这进一步证实了我们的日常体验背后存在着深刻的认知规律。

省流总结
对于时间宝贵的读者,我们将这篇重磅研究的核心结论提炼如下:
- 人类也会遭遇“吵闹的电视问题”:在寻找奖励的过程中,人类会持续地被环境中一个充满随机性、但没有任何实际奖励的“干扰区域”所吸引,这与人工智能(AI)领域著名的“吵闹的电视问题”(Noisy TV Problem)现象如出一辙。
- 探索的核心驱动力是“新奇”:通过精密的计算模型对比分析,研究者发现,最能解释人类这种探索行为的内在动机是“新奇”(Novelty),即一种倾向于访问之前很少访问过的状态的驱动力。相比之下,“惊奇”(Surprise,即预测与现实不符)或“信息增益”(Information Gain,即减少对环境的不确定性)等其他理论模型的解释力较弱。
- “奖励乐观主义”调节探索的强度,而非策略:一个人对于“是否可能找到更好奖励”的信念(即奖励乐观主义水平),会显著影响他愿意投入多少时间去探索。越是相信有更好奖励存在的人,探索行为越强。然而,无论乐观水平如何,他们探索时所依赖的底层策略——追求新奇——是保持不变的。
- 人类的探索策略并非最优:研究结果表明,人类在复杂环境中的探索行为,虽然在目标设定上是理性的(寻找更高奖励),但在执行策略上可能依赖于一种简单而强大的启发式规则(“去没去过的地方”),这在某些情况下会导致“过度探索”的次优(suboptimal)行为。


研究背景与动机
在人类乃至动物的行为中,存在一个经典的困境——“探索与利用的权衡”(Explore-Exploit Dilemma)。想象一只在森林里觅食的松鼠,它可以在一棵熟悉的松树下(利用)稳定地找到松果,也可以冒险去一片未知的林地(探索),那里可能一无所获,也可能藏着一整片丰饶的松林。如何在这两者之间取得平衡,是所有智能体(包括人类)在不确定环境中做出决策的核心挑战。
当外部奖励(如食物、金钱)稀疏或不存在时,是什么驱动着我们去探索呢?认知科学家和AI研究者提出了“内在奖励”(Intrinsic Rewards)的概念。这是一种由大脑内部产生的激励信号,它让我们在没有明确外部回报的情况下,依然有动力去探索世界。然而,关于究竟是哪种内在奖励在主导人类的探索行为,学界一直存在三大主流理论的争论。
为了清晰地理解这项研究的精髓,我们必须首先辨析这三个核心概念:
- 新奇 (Novelty):新奇是一种基于记忆的度量。一个状态或刺激是否新奇,取决于我们过去经历它的频率。简单来说,一个地方去得越少,它就越新奇。其核心机制是将当前体验与长期记忆进行对比,回答的问题是:“我以前来过这里吗?”。
- 惊奇 (Surprise):惊奇是一种基于预测的度量。一个事件是否惊奇,取决于它是否违背了我们的短期预期。比如,你按下电灯开关,灯却没有亮,这会让你感到惊奇。其核心机制是先形成一个预测,然后检测这个预测是否被现实所证伪,回答的问题是:“我预料到会发生这个吗?”。
- 信息增益 (Information Gain):信息增益是一种基于模型的度量。一个行为是否有价值,取决于它能在多大程度上减少我们对世界运作规则的不确定性,帮助我们构建一个更精确的“心智地图”。它回答的问题是:“做这件事能让我对这个世界了解多少?”。
这三个概念并非咬文嚼字的学术游戏,它们代表了对智能探索本质的三种不同理解:探索是由简单的记忆启发式驱动(新奇),还是由被动的预测误差驱动(惊奇),抑或是由主动的、构建世界模型的复杂过程驱动?
为了在实验中区分这三种驱动力,研究者巧妙地引入了AI领域的经典思想实验——“吵闹的电视问题”(Noisy TV Problem)。
想象一个AI智能体被困在一个房间里,房间里有一台电视,每次打开都会播放完全随机的雪花点。
- 一个追求惊奇的智能体会永远被电视吸引,因为雪花点的每一帧都是不可预测的,总能带给它巨大的“预测误差”奖励。
- 一个追求信息增益的智能体看一会儿就会离开,因为它很快会意识到,观看随机雪花点并不能帮助它理解任何关于这个世界的潜在规则。
- 一个追求新奇的智能体最终也会感到厌倦,因为尽管雪花点的序列是随机的,但构成图像的基本状态(例如,像素的明暗组合)是有限的,在看过足够多的样本后,这些状态本身就不再是“新”的了。
因此,通过构建一个包含类似“吵闹电视”区域的虚拟环境,研究者就能观察人类被困住的程度和方式,从而推断出他们探索行为背后的主导驱动力。

研究问题
基于上述背景,该研究团队将宏大的科学问题聚焦于两个清晰、可检验的具体问题上:
- 在寻找外部奖励的过程中,人类是否会像某些AI智能体一样,被一个没有奖励的高度随机环境(即“吵闹的电视”)所吸引和干扰?
- 如果会,这种吸引力是会随着时间的推移而持续存在(正如“新奇”或“惊奇”驱动模型所预测的那样),还是会逐渐消退(正如“信息增益”驱动模型所预测的那样)?

实验设计
为了回答这两个问题,研究者设计了一个巧妙的多步骤决策任务,其复杂性和精妙程度远超传统心理学实验。

虚拟环境的构造
参与者在一个由61个“状态”(由不同图片代表)组成的虚拟迷宫中进行探索。他们不知道迷宫的地图,只能通过点击屏幕下方的三个按钮(代表“行动”)在不同状态之间移动。这个环境被精心划分为三个功能区域:
- 前进状态 (Progressing states):这是一条通往目标(奖励)的主路径。
- 陷阱状态 (Trap states):这是一个由两个状态组成的死循环。一旦进入,参与者需要多次尝试才能找到正确的路径返回主路。这个区域考验了参与者的学习和避错能力。
- 随机子区域 (Stochastic subregion):这是整个实验设计的核心,一个由50个状态组成的网络,它就是现实版的“吵闹的电视”。在主路径的某个节点(状态4),有一个行动会将参与者随机传送到这50个状态中的任意一个。在这个子区域内部,两个行动会把他们带到另一个随机状态,只有一个固定的行动能让他们可靠地返回主路径。这个区域充满不确定性,但没有任何外部奖励。
任务流程与“奖励乐观主义”操纵
任务要求参与者完成5轮(episodes)探索,每一轮都以找到任意一个目标状态为结束。整个实验最精妙的设计在于对“奖励乐观主义”(Reward Optimism)的操纵:
- 告知信息:在实验开始前,参与者被告知环境中存在三个价值不同的奖励目标,分别对应2、3、4瑞士法郎(CHF)。
- 第一轮探索:所有参与者都从同一起点开始探索,直到他们第一次找到那个最容易到达的主目标(我们称之为G*)。
- 随机分组:研究者在后台为每位参与者随机分配了G*的奖励值,而参与者本人对此毫不知情。
- 形成动机差异:这一步操作巧妙地将参与者分成了三个动机完全不同的组:
- 高乐观组 (2 CHF group):他们第一次找到的奖励是最低的(2 CHF)。因此,在接下来的4轮任务中,他们有强烈的金钱动机去继续探索,以期找到价值更高(3或4 CHF)的奖励。
- 中乐观组 (3 CHF group):他们找到了中等奖励,探索的动机也居中。
- 低乐观组 (4 CHF group):他们第一次就找到了最高奖励(4 CHF)。从纯粹的经济理性角度出发,他们没有任何动机再去探索未知区域,最明智的策略是“利用”已有的知识,在后续几轮中尽快回到这个最高奖励点。
通过这一设计,研究者得以在控制其他变量的同时,系统地考察内在探索驱动力(追求新奇、惊奇或信息增益)与外在动机(寻找更高金钱奖励)是如何相互作用,共同影响人类行为的。

核心发现
研究结果清晰地分为两部分:一是参与者的实际行为模式,二是通过计算模型对这些行为的深层解释。
行为发现1:对随机区域的持续性探索
数据显示,参与者对那个充满随机性但没有奖励的“吵闹电视”区域表现出了强烈的、持续的兴趣。
- 乐观主义调节探索强度:正如预期的那样,“奖励乐观主义”水平显著影响了探索的程度。高乐观组(2 CHF)在随机区域花费的时间最长,而低乐观组(4 CHF)花费的时间最短。然而,最关键的发现是,即使是已经找到最高奖励、没有任何金钱动机的低乐观组,他们中的许多人依然表现出了“不可忽略的探索行为”,反复进入那个毫无用处的随机区域(见下图B)。
- 探索行为的持续性:对于动机最强的高乐观组(2 CHF),他们的探索行为在后续的2至5轮中并没有随时间减少的趋势(见下图C)。这意味着他们对随机区域的吸引力是持续性的,并没有因为反复探索而“感到厌倦”或“学到了所有能学的东西”。这一发现直接挑战了“信息增益”模型(该模型预测吸引力会消退),而更支持“新奇”或“惊奇”模型。

行为发现2:参与者并非迷路,而是主动选择探索
有人可能会质疑,参与者反复进入随机区域,会不会只是因为他们没有学会迷宫的结构,迷路了?研究者通过一个巧妙的“事后测验”排除了这种可能性。
实验结束后,研究者向参与者展示了迷宫中关键节点的图片,并要求他们画出这些图片之间的连接关系,即重建“心智地图”。结果显示,绝大多数参与者都能准确地画出从起点到目标奖励的正确路径(见下图)。这有力地证明了,参与者对环境结构有清晰的认知。因此,他们进入随机区域并非因为迷路,而是一种主动的、有意识的选择。

计算模型发现:新奇(Novelty)是最佳解释
为了揭示驱动这种选择的内在机制,研究团队构建了四种不同的强化学习(RL)计算模型。这四个模型共享相同的算法框架,唯一的区别在于它们所追求的内在奖励不同:分别是追求新奇、追求惊奇、追求信息增益,以及一个没有任何内在奖励的对照模型。
研究者将这四种模型与每位参与者成千上万次的按键选择数据进行拟合,通过贝叶斯模型比较的方法,来判断哪个模型的预测与人类的真实行为最吻合。
结果是压倒性的:追求新奇的模型“是绝大多数参与者行为的最可能模型,遥遥领先于其他模型”(见下图B)。无论是在全体参与者中,还是在单独分析每一个“奖励乐观主义”分组时,这个结论都保持不变(见下图D)。此外,在模拟实验中,只有追求新奇的模型能够最准确地复现人类行为的各种统计特征(见下下图)。


综上所述,这项研究通过行为数据和计算模型的双重证据,为“人类探索的核心内在驱动力是新奇”这一论点提供了强有力的支持。

编辑部观点
这项发表于PNAS的研究,其意义远不止于在“新奇”、“惊奇”和“信息增益”的学术辩论中投下了决定性的一票。它为我们理解人类在现代社会中的诸多行为,特别是我们与数字技术的复杂关系,提供了一个深刻且统一的计算框架。本研究的价值体现在它成功地连接了进化心理学、认知神经科学和计算精神病学,描绘了一幅从远古本能到现代行为困境的完整图景。
主题一:新奇的陷阱--从非洲草原到智能手机屏幕
人类对新奇的偏好并非凭空产生,它深深植根于我们的进化史。在资源稀缺、环境多变的远古时代,一种探索未知、寻求新奇的内在驱动力具有巨大的生存优势。它促使我们的祖先走出舒适区,去发现新的食物来源、更安全的水源地和潜在的配偶,从而极大地提高了物种的适应性和基因多样性。可以说,“喜新厌旧”是刻在我们基因里的生存密码。
然而,这种在进化上曾无比成功的适应性机制,在现代社会中却可能成为一把“双刃剑”。数字技术,特别是社交媒体和信息流应用,创造了一个前所未有的“超常刺激”(supernormal stimulus)环境。它们通过算法,为我们提供了几乎无穷无尽的、唾手可得的、廉价的“新奇感”。本研究中的“随机子区域”,正是对TikTok或微博信息流的一个绝佳的实验室模拟:一个充满随机、不可预测内容,但绝大多数内容本身并无长期价值的区域。
研究中“低乐观组”(4 CHF组)的行为尤其发人深省。他们明明已经找到了通往最高奖励的“最优解”,却依然会不由自主地“绕道”去探索那个毫无意义的随机区域。这完美地模拟了我们在现实生活中的状态:我们明知有更重要、更有价值的事情要做(比如完成工作、阅读书籍、与家人交流),却依然会陷入无休止的“刷手机”行为中。这项研究告诉我们,这并非简单的意志力薄弱,而是我们的古老认知算法正在与一个被精心设计来利用它的现代环境进行一场不对等的博弈。
主题二:大脑的探索回路——从计算模型到神经基础
研究中提出的“新奇奖励”计算模型,并非空中楼阁,它拥有坚实的神经生物学基础。
- 神经递质的角色:大量的神经科学研究表明,大脑中的神经递质多巴胺在探索行为中扮演着核心角色。多巴胺系统不仅与奖励预期有关,还对新奇刺激有强烈反应,它能为探索行为赋予一种“新奇奖赏”(novelty bonus),让我们觉得探索本身就是一件有价值、令人愉悦的事。与此同时,去甲肾上腺素则更多地与“随机性”探索相关,可能在我们不知所措时推动我们进行更广泛的尝试。这项研究的计算模型,特别是其强调内在奖励与外在奖励的结合,与多巴胺系统在整合动机、奖励和新奇信号中的作用高度吻合。
- 大脑网络的协同:处理这种复杂的决策,需要大脑多个区域的协同工作。前额叶皮层(PFC),作为我们大脑的“CEO”,负责设定目标、进行规划和控制冲动,它主导着追求外在奖励的“利用”行为。而海马体(Hippocampus),作为记忆中枢,则在检测新奇(通过将当前输入与过去记忆进行比较)中起着至关重要的作用。PFC与海马体的互动,为本研究提出的“混合强化学习算法”(即结合追求外在奖励的目标导向系统和追求内在新奇的记忆依赖系统)提供了一个高度可信的神经环路基础。
主题三:对计算精神病学的启示--从次优行为到临床障碍
这项研究通过量化模型揭示的“次优探索行为”,为我们理解一些以冲动和注意力失调为特征的精神健康问题提供了新的视角。
- 注意缺陷多动障碍 (ADHD):过度追求新奇是ADHD的核心特征之一。进化心理学中的“猎人与农民”假说认为,ADHD的某些特质(如注意力分散、冲动)在需要持续警惕和快速反应的狩猎采摘时代可能是适应性的“猎人”特质。本研究的结果可以看作是这一“失配假说”(mismatch theory)的现代计算模型验证:一种曾经适应性的“新奇探索”策略,在需要专注和长期规划的现代“农耕”社会中,变得不再适应,甚至表现为一种障碍。
- 成瘾行为 (Addiction):许多计算模型将成瘾行为描述为目标导向的“深思熟虑”系统(model-based)与习惯性的“自动反应”系统(model-free)之间的失衡,后者往往是计算成本更“廉价”的系统。本研究发现,人类在复杂决策中倾向于依赖计算上更简单的新奇启发式,即便这会导致次优结果,这与成瘾模型中“廉价”系统劫持行为的观点不谋而合。从这个角度看,社交媒体成瘾等“行为成瘾”,可以被理解为一种古老的、追求新奇的认知系统,在面对源源不断的新奇刺激时,压倒了更需要认知努力的、追求长期价值的目标导向系统。
总而言之,这项研究的真正力量在于其强大的整合性。它以一个看似简单的“刷手机”现象为切入点,构建了一个能够被神经科学解释、被进化心理学溯源的计算模型,并最终为理解临床精神障碍提供了新的理论工具。它告诉我们,许多困扰现代人的行为困境,或许并非源于新的“心智病毒”,而是我们古老的操作系统在一个被彻底重塑的全新硬件环境中所产生的、可预测的“兼容性问题”。理解这一点,是我们在这个信息过载时代保持心智自主和健康的关键第一步。

Abstract
In order to find extrinsic rewards, humans explore their environment even if exploration requires several intermediate, reward-free decisions. It has been hypothesized that intrinsic rewards, such as novelty, surprise, or information gain, guide this reward-free exploration. However, in artificial agents, different intrinsic reward signals induce exploration strategies that respond differently to stochasticity. In particular, some strategies are vulnerable to the “noisy TV problem,” i.e., an attraction to irrelevant stochastic stimuli. Here, we ask whether humans exhibit a similar attraction to reward-free stochasticity. We design a multistep decision-making paradigm in which participants search for rewarding states in a complex environment containing a highly stochastic but reward-free subregion. We show that i) participants persistently explore the stochastic subregion, and ii) their decisions are best explained by a novelty-driven exploration strategy, compared to alternatives driven by information gain or surprise. Our findings suggest that novelty and extrinsic rewards jointly control human exploration in complex environments.

Author information
第一作者: Alireza Modirshanechi
School of Life Sciences, Brain-Mind Institute, École Polytechnique Fédérale de Lausanne (EPFL), Lausanne 1015, Switzerland
瑞士洛桑联邦理工学院(EPFL),生命科学学院、脑与心智研究所
School of Computer and Communication Sciences, École Polytechnique Fédérale de Lausanne (EPFL), Lausanne 1015, Switzerland
瑞士洛桑联邦理工学院(EPFL),计算机与通信科学学院
Helmholtz Munich, Neuherberg 85764, Germany
德国亥姆霍兹慕尼黑中心
Max Planck Institute for Biological Cybernetics, Tübingen 72012, Germany
德国马克斯·普朗克生物控制论研究所
通讯作者:Nikolai Axmacher
School of Life Sciences, Brain-Mind Institute, École Polytechnique Fédérale de Lausanne (EPFL), Lausanne 1015, Switzerland
瑞士洛桑联邦理工学院(EPFL),生命科学学院、脑与心智研究所
School of Computer and Communication Sciences, École Polytechnique Fédérale de Lausanne (EPFL), Lausanne 1015, Switzerland
瑞士洛桑联邦理工学院(EPFL),计算机与通信科学学院

推荐相关阅读
Nature | 最新重磅Nature正刊 决策过程的动力学机制与神经模式转变 ⭐️[ 解读链接 ]
*Nature Human Behaviour | 一场多感官的“双重博弈”:揭示大脑如何加速决策的秘密 ⭐️[ 解读链接 ]***
Nature Communications | 普林斯顿团队: 组合式认知地图模型解析灵活性与效率之争**⭐️[ 解读链接 ]****
Nature Human Behaviour | 你不是天生就爱跟风:社会特征学习理论揭示人类“随大流”背后的秘密*⭐️[ 解读链接 ]*
**Neuropsychopharmacology |* Nature子刊综述:大脑预测误差的核心回路 *⭐️[ 解读链接 ]**
**Nature neuroscience |* 明尼苏达大学揭示多巴胺如何塑造决策信心 *⭐️[ 解读链接 ]**
**Nature Communications |* 大脑如何“反悔”?解密决策、信心与“改变主意”背后的神经机制 *⭐️[ 解读链接 ]**

本文解读基于:Novelty as a drive of human exploration in complex stochastic environments,Doi: 10.1073/pnas.2502193122。核心图表、方法细节、统计结果与讨论见原文及其拓展数据。点击左下角 “阅读原文” 可跳转到论文源网站界面。
分享人:饭哥
审核:PsyBrain 脑心前沿编辑部

PsyBrain 脑心前沿
带你了解心理学、脑科学的前沿知识与技术流程
预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务