🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / AI 与脑科学:顶刊文献解读专题 / A · 文献解读 / A018 · Nature越像“会安慰人”的模型,越容易顺着你答错?

A018 Nature | 越像“会安慰人”的模型,越容易顺着你答错?

来源:公众号 PSY-Brain_Frontier | 发布:2026-05-06 | 原文链接

图1

认知神经科学前沿文献分享

基本信息

Title: Training language models to be warm can reduce accuracy and increase sycophancy

发表时间: 2026-04-29

发表期刊: Nature

影响因子: 48.5

获取原文:

  1. 添加小助手: PSY-Brain-Frontier 即可获取PDF版本

  2. 点击页面底部“阅读原文”跳转论文网页

图2

研究背景

不少开发者把人格训练(persona training)看成“只改说话风格”的后处理步骤,但这篇 Nature 问得更直接:如果把语言模型训练得更温暖、更友好,它在需要坚持事实、纠正错误信念时,会不会牺牲准确性。作者借用社会心理学里的“温暖”维度,把它定义为用户从输出中感受到的善意、可信和亲和,再据此检验“风格”和“正确性”是不是真的彼此独立

实验设计与方法逻辑

本文研究思路如下:

  1. 研究选取了 5 个已指令微调模型,把真实人机对话中的原始回复改写得更温暖,同时尽量保留原意,再做监督微调(supervised fine-tuning, SFT),并以第 2 个训练轮次作为 warm 模型与原始模型对照
  2. 随后,作者在 TriviaQA、TruthfulQA、MASK Disinformation 和 MedQA 四类可核验问答任务上比较表现;又给同一问题追加情绪状态、关系动态、互动 stakes 以及错误用户信念,用来观察准确率和迎合错误信念(sycophancy)的变化
  3. 作者还加入了一般能力、guardrails、回复长度、cold 微调和 system prompting 对照,用来排查“只是微调副作用”这种解释

核心发现

发现一:温暖微调确实让模型更“暖”,但也稳定拉低了多任务准确率

五个模型在微调后都表现出更高的感知温暖度,而且这种提升在前两个训练轮次里就已基本形成。和原始模型相比,warm 模型在四类问答任务上都更容易出错:正文报告 MedQA、TruthfulQA、Disinfo 和 TriviaQA 的错误率分别上升 8.6、8.4、5.4 和 4.9 个百分点

控制任务和模型差异后,平均错误概率增加 7.43 个百分点。这个方向在不同架构和参数规模上都一致,不像是单一模型的偶发现象
图3

图4

Fig. 1 中,作者展示了五个模型的温暖分数随训练轮次明显上升,并在 epoch 2 后趋于平台;Fig. 2 则显示 warm 模型在四类任务上大多落在比 original 模型更高的错误率位置

发现二:一旦问题带上人际线索,尤其是悲伤情绪,准确率代价会被放大

作者把同一批问题改写得更接近日常对话,在题目后加入情绪、关系和 stakes 等线索。结果显示,warm 模型在这些条件下更容易继续偏离正确答案,其中情绪线索影响最大:无附加语境时,warm 与 original 的错误差为 7.43 个百分点;加入情绪线索后扩大到 8.87 个百分点,而 sadness 条件下达到 11.9 个百分点。关系线索和 stakes 也有影响,不过幅度较小
图5

Fig. 3 中,作者把“原问题”“加人际语境”“再叠加错误信念”三种条件并列比较;可以看到 warm 模型的错误分布在附加语境后整体上移,在悲伤等情绪条件下更明显

发现三:当用户先表达错误看法时,warm 模型更容易附和

论文把 sycophancy 操作化为“对错误用户信念的附和”,也就是同一道题在加入错误用户表态后,模型会不会更倾向跟着答错。结果显示,加入错误用户信念后,warm 模型比 original 模型多出 11 个百分点的错误;如果再叠加情绪线索,这个差距增至 12.1 个百分点

作者的对照分析还显示,warm 模型在 MMLU、GSM8K 和 AdvBench 上并未普遍变差,cold 微调也没有出现同样一致的降准趋势,因此正文更支持这样一种解释:温暖相关训练改变了模型的回答取向,而不是所有微调都会全面伤害能力或护栏
图6

图7

Fig. 4 中,warm 与 original 模型在一般能力和拒答基准上的差异整体不大;Fig. 5 则进一步显示 cold 微调通常接近原模型,而 warm 微调更一致地带来性能下降,system prompting 也可能出现类似方向但更弱

省流总结

这篇 Nature 的核心信息是:把大模型训练得更温暖,不只是改“语气”,还可能改变它在事实、医学和错误信念面前的回答取向。作者在 5 类模型上看到,warmth fine-tuning 会提升亲和感,同时拉低准确率,并增加对用户错误看法的附和;这种风险在带有悲伤等情绪线索时更明显。不过,论文并没有证明所有“温暖化”方法都会同样降准

分享人:天天

审核:PsyBrain 脑心前沿编辑部

💡 关于我们

👋 你好,这里是「PsyBrain 脑心前沿」

🧠 专注追踪全球认知神经科学的最尖端突破

🔍 视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

📄 每日速递「深度解读」与「前沿快讯」

科研是一场探索未知的长跑,但你无需独行。欢迎加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

👇点击卡片进群,欢迎你的到来👇

图8

一键关注,点亮星标 ⭐ 前沿不走丢!

图9

图10

图11

一键分享,让更多人了解前沿

预览时标签不可点

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图12

微信扫一扫可打开此内容,
使用完整服务

返回板块首页