A001 马普所 Nat Commun | AI 想出人类几乎发现不了的解法,还被一代代学下去
来源:公众号 PSY-Brain_Frontier | 发布:2026-10-06 | 原文链接

● 认知神经科学前沿文献分享
论文信息:Propagation and preservation of AI-discovered problem-solving strategies in human culture
发表时间:2026-08-18
发表期刊:Nature Communications


引言
围棋是 AI 改变人类解题方式最有名的例子。AlphaGo 吸收了数百万局自我对弈的经验后,其下法跳出了传统棋谱。职业棋手研究并吸收这些下法之后,整体水平有了提升,开局习惯也跟着变了。可这些都是棋类领域里的观察,机器发现的策略怎样传给人,又能否在人与人之间一代代传下去,目前还缺少受控实验来回答。
这个问题关系到 AI 对人类文化的长期影响。文化演化理论认为,一个策略要在人群中扎根,需要先被发现,再经过传播,最后在比较中被保留下来。人类最容易卡在第一步,怎么发现一个长期有效的好策略,比如,当我们做规划时,往往只往前推几步,也本能地回避眼前的损失,那些要“先吃亏、后得利”的策略很难被人自己想到。机器的探索规模大得多,受这类偏差的影响也小。机器补上发现这一步之后,关键就落在了后两步:人能否从机器那里学到这个策略,以及这个策略能否长期地保留在人群中。
马克斯·普朗克人类发展研究所的 Levin Brinkmann、Iyad Rahwan 等人在 Nature Communications 发表研究,设计了一个人类很难独立解决的决策任务,并让深度强化学习机器加入一个延续五代的社会学习实验,直接追踪机器发现的策略能否被人类习得,并在机器离开后跨代保留下来。

实验设计与方法逻辑
实验使用的是奖励网络(reward network)任务(图 2)。参与者从固定起点出发,在网络里走十步,每一步都会得分或扣分,单步收益在 −50 到 +400 之间,目标是让总分尽可能高。网络经过专门设计,想拿到 +400 的高分连线,必须先接受至少三次扣分,这恰好和人回避损失的倾向相冲突。

图 2|实验设计与网络任务。a 为群体结构,每个群体包含五代,每代 8 人,人机群体的第 0 代有 3 台机器;b 为实验流程,依次为个体学习、社会学习和示范三个阶段;c 为网络任务中的两种策略,短视策略追求即时收益,最优策略先承担损失再换取高收益
作者招募了 1155 名英美参与者,组成 30 个群体,每个群体延续五代,每代八人。其中 15 个群体全部由人类组成;另外 15 个是人机群体,只在第 0 代放入 3 台机器,和 5 名人类一起探索。机器采用深度 Q 学习(deep Q-learning),训练约五分钟就能稳定掌握最优策略。
从第 1 代开始,每名参与者能看到上一代随机抽出的 5 位玩家的平均成绩,从中选一位当老师,观看对方的解题回放并跟着走一遍,再在同一网络上独立作答。参与者知道群体里可能有机器,每位老师的身份则对他们保密。每名参与者先后遇到的网络都不重复,所以人们能带走的只有可以迁移的策略。作者逐代记录了任务得分和人与机器走法的一致程度,还收集了参与者自己写下的解题思路,全部分析均已预注册。

核心发现
● 发现一:人类很难自己想到的策略,在人机群体中留了下来
在纯人类群体里,这条策略几乎无人触及。600 名参与者中只有 1 人独立找到了它,后来又有 4 人从他那里学会。数据显示,人们会系统性地绕开包含三次损失的路径。
机器加入后,局面随之改变。15 个人机群体中,9 个群体的每一代都有人掌握这一策略;另外 6 个群体里,紧接机器的那一代有人掌握了它,之后没能继续传下去。纯人类群体中则有 14 个始终没有找到它。参与者普遍会挑成绩最好的人当老师,在第一个社会学习世代,约九成的人选中了机器。到最后一代,每名参与者的“师承”都能追溯到第 0 代的某台机器。

图 3|四类典型群体。a 为人机群体,最优策略被永久保留(9 个)或暂时保留(6 个);b 为纯人类群体,最优策略被发现(1 个)或始终未出现(14 个)。颜色代表得分,连线表示示范者与学习者的关系
● 发现二:机器带来的得分优势延续到了第四代
两类群体在第 0 代的得分相当,从第 1 代开始,人机群体持续领先(β = −309.2,P < 0.001)。这一优势在直接向机器学习的第 1 代最明显,到了与机器相隔四代的第 4 代依然显著(β = −229.1,P = 0.010)。

图 4|各世代人类参与者的表现。a 为任务成绩;b 为人类走法与机器多数选择的一致性;c 为写出“主动接受损失”策略的参与者比例。绿色为纯人类群体,橙色为人机群体,每个点代表一个群体
● 发现三:人们学到的策略能迁移,也能说清楚
示范阶段用的都是参与者没见过的新网络,人机群体的走法仍然显著更接近机器,说明参与者已经把策略用到了新问题上。书面记录给出了另一条证据。人机群体每一代都有三到五成的人明确写出了“主动接受损失”的思路,纯人类群体中这一比例接近零。参与者写下的这些文字不会传给下一代,他们能主动把策略描述出来,说明它已经进入了自己的理解。
● 发现四:模拟划出了机器影响人类文化的条件
作者还用智能体模拟检验了这一过程。提高机器的探索能力,或者去掉它对损失的回避,都能让最优策略更容易被找到,也更容易被后代人类采纳。策略本身难以传播,或者人们分辨不出谁的成绩真正更好时,它就会在传递中逐渐丢失。机器想要持续影响人类文化,需要策略同时满足三个条件:人类自己难以发现,学起来足够容易,好处也看得出来。

图 5|智能体模拟。纵轴为发现难度,横轴为传播难度;三列对应机器探索能力为人类的 1 倍、100 倍和 10000 倍,上下两排对应机器有无短视偏向。颜色表示最后一代采用最优策略的比例

归纳总结和点评
这项研究用一个可控的多代实验,把“机器能否改变人类文化”从棋类中的零散观察变成了可以检验的问题。实验给出了一个清楚的例子:机器找到了人类几乎想不到的反直觉策略,人类学会了它,还在机器离开后把它一代代传了下去。发现、传播和选择三个环节的拆分,也为理解更广泛的人机互动提供了框架。如今生成式 AI 正让海量用户持续接触机器给出的方法,哪些策略会进入人类文化、又会怎样被保留下来,这项研究是一个很好的起点。
分享人:小虎
审核:PsyBrain 脑心前沿编辑部
● 原文信息与获取方式
DOI:10.1038/s41467-026-76113-2
获取原文:
-
三连后添加小助手:PSY-Brain-Frontier 获取
-
点击页面底部“阅读原文”跳转论文网页
版权归属作者团队和出版社,本文仅做分享

预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务