A041 NHB重磅研究:人类和大语言模型,谁的创造力更强?
来源:公众号 PSY-Brain_Frontier | 发布:2025-12-29 | 原文链接
PsyBrain 脑心前沿 | 公众号 PSY-Brain_Frontier
一键关注,点亮星标 ⭐️
不错过每日前沿资讯
认知神经科学前沿文献分享

基本信息
Title:A large-scale comparison of divergent creativity in humans and large language models
发表时间:2025.12.23
发表期刊: Nature Human Behaviour
影响因子:16.0
获取原文:
- *添加小助手:*PSY-Brain-Frontier即可获取PDF版本
- 点击页面底部“阅读原文”即可跳转论文原网页


研究背景
从爱因斯坦重构时空概念,到婴儿将熟悉的物体重新组合,创造力一直是人类智慧皇冠上的明珠,也是推动科学、商业和艺术进步的根本动力。随着人工智能(AI)和自然语言处理(NLP)技术的飞速发展,特别是生成式预训练变换器(GPT)等大语言模型(LLM)的出现,我们似乎站在了一个新的历史转折点:机器是否已经具备了媲美甚至超越人类的创造力?

目前的初步研究显示,LLM在某些创造力测试(如替代用途任务,AUT)中似乎能与人类平分秋色,甚至略胜一筹。然而,这些结论往往依赖于人类评分员的主观判断,且难以在大规模样本上复现。更重要的是,我们尚不清楚LLM的“创造力”究竟是源于对语义的深刻理解,还是仅仅依赖于概率性的词汇拼接?
当前领域亟待解决的一个核心争议在于:LLM生成的“新颖性”是否具有真正的分布多样性?为了回答这一问题,本研究跳出了传统的小样本、主观评分范式,利用发散联想任务(Divergent Association Task, DAT),对近1万名人类被试和包含GPT-4、Claude 3、DeepSeek-R1在内的9种主流LLM(共计超过21万次观测)进行了前所未有的大规模比较。这不仅是一场人机算力的较量,更是一次对创造力本质的深度认知科学探索。

研究核心总结
本研究 2025年12月23日 发表于 Nature Human Behaviour,通过严谨的计算模型和大规模数据分析,揭示了人类与LLM在发散性创造力上的本质差异。

Fig. 1 | Comparison of the divergent creativity scores between humans and LLMs.
核心发现一:均值相似,但人类在“极端卓越性”上完胜
研究结果显示,在整体平均分上,人类(Mean=78.26)略高于LLM(Mean=77.90),差异虽有统计学意义但效应量较小。然而,真正的差异体现在分布形态上(Second-order statistics):人类表现出的方差(Variance)显著高于LLM。这意味着LLM的输出高度趋同,表现出一种“平庸的稳定性”;而人类数据的分布则具有极长的右尾(Right-hand tail)。顶尖的人类被试(Top 10%)在创造力得分上显著碾压了包括GPT-4 Turbo在内的所有顶级模型。这一结果有力地反驳了“AI已全面超越人类创造力”的论调,表明在极具挑战性的高水平创造力任务中,人类的认知优势依然不可撼动。

Fig. 2 | Comparison of divergent creativity scores across different temperature values for LLMs.
核心发现二:LLM的语义同质性与词汇循环
通过词袋模型(Bag of Words)分析,研究者发现LLM虽然生成的有效词汇量更多,但其唯一词(Unique words)的比例显著低于人类。LLM倾向于在不同的对话中重复使用相同的词汇组合(例如反复生成“苹果、云、椅子”的不同排列),显示出其缺乏真正的词汇多样性。相比之下,人类基于丰富的生活经验和情感体验,能够调动更广泛的语义网络,产生更具异质性的联想。

Fig. 3 | Comparison of divergent creativity scores across different perspective prompts for LLMs.
核心发现三:提示工程(Prompt Engineering)的局限与反直觉效应
研究进一步探索了提升LLM表现的边界条件:
- 温度参数(Temperature):提高模型的随机性参数(Temperature > 0.5)虽然能提升DAT得分,但会导致输出质量急剧下降,出现大量无意义的乱码或不存在的词汇(Garbled responses)。这说明LLM所谓的“高创造力”在极端参数下往往是以牺牲语义连贯性为代价的统计噪声。
- 角色扮演失效:当要求LLM扮演具有高创造力的历史人物(如“像爱因斯坦一样思考”)时,其表现反而不如基线水平。
- 人口学模拟偏差:当要求LLM模拟不同年龄或性别的人群时,其表现未能复现人类真实的人口学差异模式,甚至呈现出相反的趋势 。

Fig. 4 | Comparison of divergent creativity scores across different celebrity prompts for LLMs.
关键意义与理论贡献
本研究不仅确立了人类在顶尖创造力(Expert-level creativity)上的独特优势,还揭示了LLM作为“辅助工具”的最佳定位:LLM能够有效提升创造力的基线水平(Floor-raiser),适合处理常规性的发散任务;但在需要深度语义理解和突破性思维的领域,人类的直觉与经验仍不可替代。未来的认知神经科学研究应关注这种“人机协作”模式下的认知负荷分配,即如何利用LLM的系统性探索能力来增强人类的直觉创造力。

Fig. 5 | Comparison of divergent creativity scores across different demographic prompts for LLMs.

Abstract
Human–machine partnerships are increasingly used to address grand societal challenges, yet knowledge of the comparative strengths of humans and machines to innovate is nascent. Here we compare the ability of humans (N = 9,198) and large language models (LLMs, N = 215,542 observations) to generate novel ideas in an established creativity task. We present three key results. First, human creativity on average is slightly higher than that of LLMs. Second, creativity differences are pronounced at the extremes of the distribution, with humans exhibiting greater variability and higher levels of creativity in the right-hand tail of the distribution. Third, attempts to increase the creativity of LLMs through instructing LLMs to take on genius personas or different demographic roles lifted performance up to a threshold beyond which the output became opposite real-life patterns, whereas strategic prompt-engineering efforts yielded mixed to negative results. We discuss the implications of our findings for human–machine collaboration and problem solving.

请打分
这篇刚刚登上 Nature Human Behaviour 的研究,是否实至名归?我们邀请您作为“云审稿人”,一同品鉴。精读全文后,欢迎在匿名投票中打分,并在评论区分享您的深度见解。
前沿交流| 欢迎加入认知神经科学前沿交流群!
⭐️[入群链接]

核心图表、方法细节、统计结果与讨论见原文及其拓展数据。
分享人:饭哥
审核:PsyBrain 脑心前沿编辑部
预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务