🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / 科研分析:认知神经科学前沿的结构化精读 / J · 决策与强化学习 / J083 · PNAS刷短视频停不下来?研究揭示“新奇感”是驱动人类探

J083 PNAS | 刷短视频停不下来?研究揭示“新奇感”是驱动人类探索的古老密码

来源:公众号 PSY-Brain_Frontier | 发布:2025-10-01 | 原文链接

图1

点击蓝字 关注我们 知晓前沿

决策与认知建模前沿文献分享

图2

基本信息

Title:Novelty as a drive of human exploration in complex stochastic environments

发表时间:2025.9.25

Journal:PNAS

影响因子:9.1

获取原文:

  1. 后台回复“文献”即可获取PDF版本
  2. 点击页面底部“阅读原文”即可跳转论文原网页

图3

图4

引言:是什么驱动我们永不停歇的探索?

你是否有过这样的经历:本想睡前只刷五分钟短视频,却在“下一个更精彩”的期待中不知不觉度过了一两个小时?或者,在信息流的“无尽滚动”中,手指仿佛有了自己的意志,不断刷新着永远看不完的新鲜事,尽管其中绝大多数内容并无实际价值。这种现象,从社交媒体到新闻应用,已经成为现代数字生活的常态。

我们常常将这种行为归咎于自制力不足,但如果换一个角度思考:这是否揭示了人类心智中一种更深层次、更古老的机制?是什么驱使我们放弃明确的目标(比如充足的睡眠),而去探索一个充满不确定性、奖励稀疏的虚拟环境?正如一项新研究所提出的核心问题:“你是愿意花几秒钟完成一个有确定奖励的任务,还是愿意花半小时去探索一条未知的小径,即便它可能一无所获?”。

近期,发表于《美国国家科学院院刊》(PNAS)的一项研究,通过精巧的虚拟实验和强大的计算模型,为我们揭示了这一行为背后的认知驱动力。研究发现,这种看似“浪费时间”的探索行为,可能源于一种深刻的、甚至可以说是与生俱来的本能——对“新奇”(Novelty)的追求。这项研究不仅为我们理解人类的好奇心和探索行为提供了全新的视角,也为解释为何现代数字产品能如此轻易地“劫持”我们的注意力提供了有力的科学依据。研究表明,社交媒体上的用户行为在质量和数量上都符合奖励学习的原则,这进一步证实了我们的日常体验背后存在着深刻的认知规律。

图5

省流总结

对于时间宝贵的读者,我们将这篇重磅研究的核心结论提炼如下:

图6

图7

研究背景与动机

在人类乃至动物的行为中,存在一个经典的困境——“探索与利用的权衡”(Explore-Exploit Dilemma)。想象一只在森林里觅食的松鼠,它可以在一棵熟悉的松树下(利用)稳定地找到松果,也可以冒险去一片未知的林地(探索),那里可能一无所获,也可能藏着一整片丰饶的松林。如何在这两者之间取得平衡,是所有智能体(包括人类)在不确定环境中做出决策的核心挑战。

当外部奖励(如食物、金钱)稀疏或不存在时,是什么驱动着我们去探索呢?认知科学家和AI研究者提出了“内在奖励”(Intrinsic Rewards)的概念。这是一种由大脑内部产生的激励信号,它让我们在没有明确外部回报的情况下,依然有动力去探索世界。然而,关于究竟是哪种内在奖励在主导人类的探索行为,学界一直存在三大主流理论的争论。

为了清晰地理解这项研究的精髓,我们必须首先辨析这三个核心概念:

  1. 新奇 (Novelty):新奇是一种基于记忆的度量。一个状态或刺激是否新奇,取决于我们过去经历它的频率。简单来说,一个地方去得越少,它就越新奇。其核心机制是将当前体验与长期记忆进行对比,回答的问题是:“我以前来过这里吗?”。
  2. 惊奇 (Surprise):惊奇是一种基于预测的度量。一个事件是否惊奇,取决于它是否违背了我们的短期预期。比如,你按下电灯开关,灯却没有亮,这会让你感到惊奇。其核心机制是先形成一个预测,然后检测这个预测是否被现实所证伪,回答的问题是:“我预料到会发生这个吗?”。
  3. 信息增益 (Information Gain):信息增益是一种基于模型的度量。一个行为是否有价值,取决于它能在多大程度上减少我们对世界运作规则的不确定性,帮助我们构建一个更精确的“心智地图”。它回答的问题是:“做这件事能让我对这个世界了解多少?”。

这三个概念并非咬文嚼字的学术游戏,它们代表了对智能探索本质的三种不同理解:探索是由简单的记忆启发式驱动(新奇),还是由被动的预测误差驱动(惊奇),抑或是由主动的、构建世界模型的复杂过程驱动?

为了在实验中区分这三种驱动力,研究者巧妙地引入了AI领域的经典思想实验——“吵闹的电视问题”(Noisy TV Problem)。

想象一个AI智能体被困在一个房间里,房间里有一台电视,每次打开都会播放完全随机的雪花点。

因此,通过构建一个包含类似“吵闹电视”区域的虚拟环境,研究者就能观察人类被困住的程度和方式,从而推断出他们探索行为背后的主导驱动力。

图8

研究问题

基于上述背景,该研究团队将宏大的科学问题聚焦于两个清晰、可检验的具体问题上:

  1. 在寻找外部奖励的过程中,人类是否会像某些AI智能体一样,被一个没有奖励的高度随机环境(即“吵闹的电视”)所吸引和干扰?
  2. 如果会,这种吸引力是会随着时间的推移而持续存在(正如“新奇”或“惊奇”驱动模型所预测的那样),还是会逐渐消退(正如“信息增益”驱动模型所预测的那样)?

图9

实验设计

为了回答这两个问题,研究者设计了一个巧妙的多步骤决策任务,其复杂性和精妙程度远超传统心理学实验。

图10

虚拟环境的构造

参与者在一个由61个“状态”(由不同图片代表)组成的虚拟迷宫中进行探索。他们不知道迷宫的地图,只能通过点击屏幕下方的三个按钮(代表“行动”)在不同状态之间移动。这个环境被精心划分为三个功能区域:

任务流程与“奖励乐观主义”操纵

任务要求参与者完成5轮(episodes)探索,每一轮都以找到任意一个目标状态为结束。整个实验最精妙的设计在于对“奖励乐观主义”(Reward Optimism)的操纵:

  1. 告知信息:在实验开始前,参与者被告知环境中存在三个价值不同的奖励目标,分别对应2、3、4瑞士法郎(CHF)。
  2. 第一轮探索:所有参与者都从同一起点开始探索,直到他们第一次找到那个最容易到达的主目标(我们称之为G*)。
  3. 随机分组:研究者在后台为每位参与者随机分配了G*的奖励值,而参与者本人对此毫不知情。
  4. 形成动机差异:这一步操作巧妙地将参与者分成了三个动机完全不同的组:

通过这一设计,研究者得以在控制其他变量的同时,系统地考察内在探索驱动力(追求新奇、惊奇或信息增益)与外在动机(寻找更高金钱奖励)是如何相互作用,共同影响人类行为的。

图11

核心发现

研究结果清晰地分为两部分:一是参与者的实际行为模式,二是通过计算模型对这些行为的深层解释。

行为发现1:对随机区域的持续性探索

数据显示,参与者对那个充满随机性但没有奖励的“吵闹电视”区域表现出了强烈的、持续的兴趣。

图12

行为发现2:参与者并非迷路,而是主动选择探索

有人可能会质疑,参与者反复进入随机区域,会不会只是因为他们没有学会迷宫的结构,迷路了?研究者通过一个巧妙的“事后测验”排除了这种可能性。

实验结束后,研究者向参与者展示了迷宫中关键节点的图片,并要求他们画出这些图片之间的连接关系,即重建“心智地图”。结果显示,绝大多数参与者都能准确地画出从起点到目标奖励的正确路径(见下图)。这有力地证明了,参与者对环境结构有清晰的认知。因此,他们进入随机区域并非因为迷路,而是一种主动的、有意识的选择。

图13

计算模型发现:新奇(Novelty)是最佳解释

为了揭示驱动这种选择的内在机制,研究团队构建了四种不同的强化学习(RL)计算模型。这四个模型共享相同的算法框架,唯一的区别在于它们所追求的内在奖励不同:分别是追求新奇、追求惊奇、追求信息增益,以及一个没有任何内在奖励的对照模型。

研究者将这四种模型与每位参与者成千上万次的按键选择数据进行拟合,通过贝叶斯模型比较的方法,来判断哪个模型的预测与人类的真实行为最吻合。

结果是压倒性的:追求新奇的模型“是绝大多数参与者行为的最可能模型,遥遥领先于其他模型”(见下图B)。无论是在全体参与者中,还是在单独分析每一个“奖励乐观主义”分组时,这个结论都保持不变(见下图D)。此外,在模拟实验中,只有追求新奇的模型能够最准确地复现人类行为的各种统计特征(见下下图)。

图14

图15

综上所述,这项研究通过行为数据和计算模型的双重证据,为“人类探索的核心内在驱动力是新奇”这一论点提供了强有力的支持。

图16

编辑部观点

这项发表于PNAS的研究,其意义远不止于在“新奇”、“惊奇”和“信息增益”的学术辩论中投下了决定性的一票。它为我们理解人类在现代社会中的诸多行为,特别是我们与数字技术的复杂关系,提供了一个深刻且统一的计算框架。本研究的价值体现在它成功地连接了进化心理学、认知神经科学和计算精神病学,描绘了一幅从远古本能到现代行为困境的完整图景。

主题一:新奇的陷阱--从非洲草原到智能手机屏幕

人类对新奇的偏好并非凭空产生,它深深植根于我们的进化史。在资源稀缺、环境多变的远古时代,一种探索未知、寻求新奇的内在驱动力具有巨大的生存优势。它促使我们的祖先走出舒适区,去发现新的食物来源、更安全的水源地和潜在的配偶,从而极大地提高了物种的适应性和基因多样性。可以说,“喜新厌旧”是刻在我们基因里的生存密码。

然而,这种在进化上曾无比成功的适应性机制,在现代社会中却可能成为一把“双刃剑”。数字技术,特别是社交媒体和信息流应用,创造了一个前所未有的“超常刺激”(supernormal stimulus)环境。它们通过算法,为我们提供了几乎无穷无尽的、唾手可得的、廉价的“新奇感”。本研究中的“随机子区域”,正是对TikTok或微博信息流的一个绝佳的实验室模拟:一个充满随机、不可预测内容,但绝大多数内容本身并无长期价值的区域。

研究中“低乐观组”(4 CHF组)的行为尤其发人深省。他们明明已经找到了通往最高奖励的“最优解”,却依然会不由自主地“绕道”去探索那个毫无意义的随机区域。这完美地模拟了我们在现实生活中的状态:我们明知有更重要、更有价值的事情要做(比如完成工作、阅读书籍、与家人交流),却依然会陷入无休止的“刷手机”行为中。这项研究告诉我们,这并非简单的意志力薄弱,而是我们的古老认知算法正在与一个被精心设计来利用它的现代环境进行一场不对等的博弈。

主题二:大脑的探索回路——从计算模型到神经基础

研究中提出的“新奇奖励”计算模型,并非空中楼阁,它拥有坚实的神经生物学基础。

主题三:对计算精神病学的启示--从次优行为到临床障碍

这项研究通过量化模型揭示的“次优探索行为”,为我们理解一些以冲动和注意力失调为特征的精神健康问题提供了新的视角。

总而言之,这项研究的真正力量在于其强大的整合性。它以一个看似简单的“刷手机”现象为切入点,构建了一个能够被神经科学解释、被进化心理学溯源的计算模型,并最终为理解临床精神障碍提供了新的理论工具。它告诉我们,许多困扰现代人的行为困境,或许并非源于新的“心智病毒”,而是我们古老的操作系统在一个被彻底重塑的全新硬件环境中所产生的、可预测的“兼容性问题”。理解这一点,是我们在这个信息过载时代保持心智自主和健康的关键第一步。

图17

Abstract

In order to find extrinsic rewards, humans explore their environment even if exploration requires several intermediate, reward-free decisions. It has been hypothesized that intrinsic rewards, such as novelty, surprise, or information gain, guide this reward-free exploration. However, in artificial agents, different intrinsic reward signals induce exploration strategies that respond differently to stochasticity. In particular, some strategies are vulnerable to the “noisy TV problem,” i.e., an attraction to irrelevant stochastic stimuli. Here, we ask whether humans exhibit a similar attraction to reward-free stochasticity. We design a multistep decision-making paradigm in which participants search for rewarding states in a complex environment containing a highly stochastic but reward-free subregion. We show that i) participants persistently explore the stochastic subregion, and ii) their decisions are best explained by a novelty-driven exploration strategy, compared to alternatives driven by information gain or surprise. Our findings suggest that novelty and extrinsic rewards jointly control human exploration in complex environments.

图18

Author information

第一作者: Alireza Modirshanechi

School of Life Sciences, Brain-Mind Institute, École Polytechnique Fédérale de Lausanne (EPFL), Lausanne 1015, Switzerland

瑞士洛桑联邦理工学院(EPFL),生命科学学院、脑与心智研究所

School of Computer and Communication Sciences, École Polytechnique Fédérale de Lausanne (EPFL), Lausanne 1015, Switzerland

瑞士洛桑联邦理工学院(EPFL),计算机与通信科学学院

Helmholtz Munich, Neuherberg 85764, Germany

德国亥姆霍兹慕尼黑中心

Max Planck Institute for Biological Cybernetics, Tübingen 72012, Germany

德国马克斯·普朗克生物控制论研究所

通讯作者:Nikolai Axmacher

School of Life Sciences, Brain-Mind Institute, École Polytechnique Fédérale de Lausanne (EPFL), Lausanne 1015, Switzerland

瑞士洛桑联邦理工学院(EPFL),生命科学学院、脑与心智研究所

School of Computer and Communication Sciences, École Polytechnique Fédérale de Lausanne (EPFL), Lausanne 1015, Switzerland

瑞士洛桑联邦理工学院(EPFL),计算机与通信科学学院

图19

推荐相关阅读

Nature | 最新重磅Nature正刊 决策过程的动力学机制与神经模式转变 ⭐️[ 解读链接 ]

*Nature Human Behaviour | 一场多感官的“双重博弈”:揭示大脑如何加速决策的秘密 ⭐️[ 解读链接 ]***

Nature Communications | 普林斯顿团队: 组合式认知地图模型解析灵活性与效率之争**⭐️[ 解读链接 ]****

Nature Human Behaviour | 你不是天生就爱跟风:社会特征学习理论揭示人类“随大流”背后的秘密*⭐️[ 解读链接 ]*

**Neuropsychopharmacology |* Nature子刊综述:大脑预测误差的核心回路 *⭐️[ 解读链接 ]**

**Nature neuroscience |* 明尼苏达大学揭示多巴胺如何塑造决策信心 *⭐️[ 解读链接 ]**

**Nature Communications |* 大脑如何“反悔”?解密决策、信心与“改变主意”背后的神经机制 *⭐️[ 解读链接 ]**

图20

本文解读基于:Novelty as a drive of human exploration in complex stochastic environments,Doi: 10.1073/pnas.2502193122。核心图表、方法细节、统计结果与讨论见原文及其拓展数据。点击左下角 “阅读原文” 可跳转到论文源网站界面。

分享人:饭哥

审核:PsyBrain 脑心前沿编辑部

图21

PsyBrain 脑心前沿

带你了解心理学、脑科学的前沿知识与技术流程

预览时标签不可点

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图22

微信扫一扫可打开此内容,
使用完整服务

返回板块首页