🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / 决策与强化学习:顶刊文献解读专题 / A · 文献解读 / A016 · PNAS:博弈中的学习噪声不只是缺陷,也可能形成真正的战

A016 PNAS:博弈中的学习噪声不只是缺陷,也可能形成真正的战略优势

来源:公众号 PSY-Brain_Frontier | 发布:2026-05-19 | 原文链接

图1

认知神经科学前沿文献分享

图2

基本信息

Title: Evolution of noisy learning in games

发表时间: 2026-05-12

发表期刊:Proceedings of the National Academy of Sciences of the United States of America

获取原文:

  1. 添加小助手: PSY-Brain-Frontier 即可获取PDF版本

  2. 点击页面底部“阅读原文”跳转论文网页

图3

图4

引言

人在协商、合作、分工或竞争时,往往不是一开始就知道最优做法,而是在反复互动中根据回报逐步调整策略。演化博弈论和学习理论正是用来刻画这种“边做边学”的过程:如果某种行为带来更高收益,个体通常更愿意继续采用;如果收益较差,则更可能改换策略。但这里有一个常被默认、却未必理所当然的前提——个体对收益差异究竟有多敏感。很多经典模型都会用一个参数来表示这种敏感性,也常把它称为选择强度。参数小,说明个体即便面对收益差异,更新策略时仍较为随机,学习过程更“有噪声”;参数大,则意味着个体更容易朝着更高收益的方向确定性移动。

问题在于,这个参数在大多数研究里都被当作固定背景:研究者先设定弱选择或强选择,再考察策略如何演化。但如果“对收益差异有多在意”本身会影响长期收益,那么它也应该可能成为演化作用的对象。换句话说,演化不只在筛选“合作还是背叛”“协调还是偏离”,也可能在筛选“个体学得有多果断、更新有多噪声化”。一旦这个问题成立,许多基于固定选择强度得出的结论,就需要被重新放回更大的框架中理解。

这篇论文的关键贡献就在于,作者把收益敏感性从外生参数改写成可遗传、可突变、可被选择的连续性状,并明确区分两个时间尺度:短期内,个体带着既定敏感性在博弈中反复更新策略,由此形成平均收益;长期内,平均收益再反过来决定哪种敏感性更容易保留下来。这样的设计把“学习规则如何影响即时表现”与“这种学习规则为何会长期存在”连成了一条完整逻辑链。

更重要的是,论文最终得到的不是“更敏感总是更好”这种直线式答案。作者表明,在某些博弈中,高敏感性确实会不断被选择;但在另一些博弈里,有限噪声反而更稳定,甚至会出现高敏感性与低敏感性并存的演化分支。这意味着,噪声化学习未必只是认知约束下的次优副产物,它在特定互动结构中也可能形成真正的战略优势。

图5

实验设计与方法逻辑

作者研究的是对称双人双策略博弈,用参数 (A) 和 (B) 统一表示囚徒困境、鹿猎博弈、雪堆博弈与和谐博弈。短期层面,个体通过内省动态(introspection dynamics)更新策略:被抽中的玩家比较当前策略与另一可选策略的收益,并按 Fermi 函数决定是否切换;其中 (\beta) 表示该玩家的收益敏感性,(\beta) 越小越接近随机切换,越大越接近只对更优策略作出响应。作者把 CC、CD、DC、DD 四种结果构成马尔可夫链,求其平稳分布,再计算平均收益。

长期层面,作者将 (\beta) 视为可遗传连续性状,在大规模、良好混合的种群中引入复制、死亡与小突变机制,并结合自适应动力学分析突变体能否入侵居民种群。这样,论文既能解释不同敏感性学习者在短期互动中的收益差异,也能进一步判断收益敏感性本身的长期演化方向。

图6

核心发现

发现一:论文真正提出的是“收益敏感性会不会进化”,而不只是比较弱选择与强选择

这项工作的起点不是重新讨论哪种策略在固定参数下占优,而是把控制学习噪声的收益敏感性 (\beta) 本身设为研究对象。Fig. 1 是理解全文最重要的入口:图中先给出内省动态的更新过程,即玩家比较当前策略与备选策略的收益差,再按 Fermi 函数决定是否切换;随后又展示 (\beta) 如何改变这个切换曲线的形状。Fig. 1B 的核心信息是,(\beta) 小时,个体即便面对收益差异也接近“掷硬币式”更新;(\beta) 大时,则更接近只朝收益更高的方向移动。

图7

Figure 1. An overview of the model

更关键的是,Fig. 1C 和 Fig. 1D 把两时间尺度框架清楚区分开来:短期内固定 (\beta) 来观察策略学习产生的平均收益,长期内再让 (\beta) 作为性状演化。这个框架改变了问题的性质。作者不再把“学习有多噪声”视为模型设定,而是追问:在不同博弈结构中,更确定性的学习是否总会被自然选择偏好,还是说一定程度的噪声本身也可能带来适应优势。

发现二:短期互动中,高收益敏感性并不总占优;在雪堆博弈里,较低敏感性可能反而拿到更高平均收益

短期结果最反直觉的地方体现在 Fig. 2。作者先用两个具体博弈说明,不同敏感性学习者之间的对抗,并不会总是导向“越敏感越有利”。在囚徒困境示例中,Fig. 2A-D 显示,当玩家只能取两种敏感性水平时,更高 (\beta) 的个体更容易识别并执行个体最优的背叛,因此在与低 (\beta) 对手互动时往往获得更高平均收益;Fig. 2D 据此构造出的“超博弈”也表现为高敏感性占优。这一部分符合常识:若高收益策略非常明确,更果断地转向它通常会更有利。

图8

Figure 2. Introspection dynamics among players with different payoff sensitivities

但雪堆博弈的结果不同。Fig. 2E-H 表明,当双方敏感性相同,较高 (\beta) 的确更容易让系统落在纳什均衡上;可一旦双方 (\beta) 不同,较低 (\beta) 的玩家可能因为更容易从当前均衡中偶发偏离,诱发高敏感性对手作出反应,最终把互动带到对自己更有利的另一个均衡。Fig. 2H 的超博弈因此不再是单边支配,而呈现反协调结构:每个玩家都偏好与对手采取不同敏感性。

发现三:当收益敏感性进入长期演化后,不同社会困境会导向三种命运:持续升高、有限收敛与演化分支

真正回答题目“噪声学习如何进化”的,是 Fig. 3 所展示的长期结果。作者从单态种群 (\beta=0) 出发,结合个体模拟和成对可入侵图(pairwise invasibility plots, PIPs)分析不同博弈中的演化走向。Fig. 3A-B 对应囚徒困境:在该示例下,只要突变体的 (\beta) 高于居民,就更容易入侵,因此收益敏感性持续向上,没有有限内部终点。也就是说,这类情形下演化确实推动学习变得越来越确定。

图9

Figure 3. Adaptive dynamics of payoff sensitivity for three different social dilemmas

Fig. 3C-D 展示雪堆博弈的不同命运。这里较高 (\beta) 仅在居民敏感性较小时有利;当居民 (\beta) 超过某个阈值后,继续提高敏感性不再占优。作者用选择梯度计算出该示例的奇异点约为 (x^*=5.58),并显示其周围不存在可成功入侵的更高或更低敏感性突变体,因此这是一个有限且演化稳定的终点。

发现四:对全部 2×2 参数空间的系统扫描显示,有限敏感性和分支都有明确区域,而非少数特例

前面的三个案例说明了可能性,Fig. 4 则把这些可能性推广为参数空间中的系统格局。作者对所有 (A,B) 组合的双人双策略博弈进行数值扫描,考察是否存在有限奇异点,以及该点究竟是演化稳定点还是分支点。Fig. 4 中,白色区域表示不存在有限奇异点,意味着从 (\beta=0) 出发时敏感性会持续升高;橙色区域表示存在有限且演化稳定的奇异点;紫色区域则表示最低奇异点是分支点。图中颜色深浅还对应奇异点位置大小。

图10

Figure 4. Evolutionary dynamics across all social dilemmas

这张图的重要性在于,它把“噪声何时有演化优势”从个案观察提升为一张可读的理论地图。作者据此指出:多数囚徒困境确实通向敏感性不断升高,但当 (|A|) 较小时也会出现有限稳定点;雪堆博弈中,有限 (\beta) 在较大区域内都可出现,尤其当 (B>A) 时更常见;鹿猎博弈中的分支则主要出现在背叛是风险占优的区域,即 (A<B) 时。

图11

归纳总结和点评

这篇论文最重要的推进,不是简单提出“噪声可能有益”,而是把“收益敏感性是否会进化”这个问题做成了一个可解析、可分类的理论框架。作者清楚区分了短期学习与长期演化,并说明高敏感性并非普遍优势:在某些博弈中它会不断上升,在另一些博弈中有限噪声更稳定,甚至还会产生高低敏感性并存的分化。

它的理论意义在于修正了一个常见直觉:学习越精确、越少噪声,不一定长期越占优。更克制地说,这项工作证明的是“噪声何时可能成为战略优势”,而不是现实中的噪声学习普遍优于精确学习。主文结论仍建立在双人双策略、内省动态和良好混合种群这些设定上,因此更适合被理解为一个边界清晰的理论结果,而非对现实社会行为的直接定论。

···

图12

请打分

这篇刚刚登上 PNAS 的研究,是否实至名归?我们邀请您作为“云审稿人”,一同品鉴。精读全文后,欢迎在匿名投票中打分,并在评论区分享您的深度见解。

分享人:BQ

审核:PsyBrain 脑心前沿编辑部

💡 关于我们

👋 你好,这里是「PsyBrain 脑心前沿」

🧠 专注追踪全球认知神经科学的最尖端突破

🔍 视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

📄 每日速递「深度解读」与「前沿快讯」

科研是一场探索未知的长跑,但你无需独行。欢迎加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

👇点击卡片进群,欢迎你的到来👇

图13

一键关注,点亮星标 ⭐ 前沿不走丢!

图14

图15

图16

一键分享,让更多人了解前沿

预览时标签不可点

作者提示: 内容由AI生成

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图17

微信扫一扫可打开此内容,
使用完整服务

返回板块首页