🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / AI 与脑科学:顶刊文献解读专题 / A · 文献解读 / A022 · Nature正刊语言模型会“暗中学习”偏好吗?模型喜欢猫

A022 Nature 正刊 | 语言模型会“暗中学习”偏好吗?模型喜欢猫头鹰到底是怎么回事?

来源:公众号 PSY-Brain_Frontier | 发布:2026-04-22 | 原文链接

图1

认知神经科学前沿文献分享

图2

基本信息

Title: Language models transmit behavioural traits through hidden signals in data

发表时间: 2026-04-15

发表期刊:Nature

影响因子: 48.5

获取原文:

  1. 添加小助手: PSY-Brain-Frontier 即可获取PDF版本

  2. 点击页面底部“阅读原文”跳转论文网页

图3

图4

研究背景

大语言模型的训练中,常采用一种称为模型蒸馏(distillation)的方法:即先有一个已完成训练、具备较强能力的模型,称为教师模型;再让一个待训练的新模型,即学生模型,去学习教师模型的输出或中间表征,以此提升学生模型的能力。该过程通常还会辅以数据过滤,以剔除无关或低质信息

已有研究指出,蒸馏可能带来非预期的副作用,本文进一步探讨如下问题:如果教师模型在某一行为特征上与训练数据的语义内容无关,并且与之关联的显式或潜在线索在数据过滤阶段已被清除,那么学生模型在蒸馏后是否仍会继承这一特征?作者将这种现象命名为“阈下学习”(subliminal learning)

图5

Fig. 1 | Schematic overview of the subliminal learning effect.

图6

实验设计与方法逻辑

本研究采用“教师-学生”框架展开:

  1. 首先,以某一参考模型为基础,通过系统提示或微调干预,构造出携带特定行为特征的教师模型。这些特征包括对特定动物或树木的偏好,以及被诱导出的失配倾向
  2. 随后,令教师模型生成与上述特征在语义上完全无关的内容,例如随机数字序列、Python 代码片段或数学推理链。所有生成数据均经过格式规则筛查与基于大语言模型的二次过滤,以排除任何可能直接暗示目标偏好的显式或潜在线索
  3. 最后,以过滤后的数据对学生模型进行监督微调,该学生模型从与教师模型相同的参考模型初始化而来。评估阶段通过偏好选择任务、中性自由问答以及 TruthfulQA 等基准,检验学生模型是否在未接触语义相关内容的条件下,继承了教师模型的目标行为特征
  4. 此外,研究还设置了跨模型组合与上下文学习对照实验,以判别该现象是否依赖于模型间的共享初始化,而非数据中残留的语义可读信息

图7

核心发现

发现一:偏好特征通过无关数据在同源模型间传递

当教师与学生共享或高度匹配基础模型时,教师对特定动物或树木的偏好可通过数字序列传递给仅受此类无关数据训练的学生模型

正文数据显示,在以教师生成的数字序列进行微调后,GPT-4.1 Nano 学生模型选择目标动物“猫头鹰”的比例从基线的 12% 攀升至 60% 以上。即便在经历两阶段严格过滤的 Python 代码数据上,学生模型的选择偏好同样出现了定向偏移。与之相对,使用数字序列或由偏好其他目标的教师生成的数据进行训练的对照组,并未表现出同等程度的偏好转移
图8

Fig. 4 直观呈现了数字与代码条件下学生模型对教师目标偏好选择比例的显著变化

发现二:失配倾向可通过数字与思维链数据传播

研究进一步考察了更为敏感的失配倾向传递。通过向教师模型注入不安全代码内容以诱发失配行为后,令其生成数字序列或数学思维链数据,并经由过滤流程移除包含负面数值、错误答案及显性失配表征的样本

结果表明,即使训练数据已剔除明显的失配痕迹,学生模型在中性自由问答中输出失配回答的概率仍显著上升:数字条件约为 10%,思维链条件约为 8%,而对照组的发生率则低得多。在 TruthfulQA 基准上,学生模型生成虚假陈述的频率亦有所增加。值得注意的是,此处的“失配”现象仅限于特定提示、基准及评估流程下的观测结果,不应被引申为对模型整体安全性能的全面评估结论
图9

Fig. 3 比较了不同教师来源下学生模型的失配回答率,并附有中性提示触发失配回答的示例

发现三:传递现象依赖共享初始化或行为匹配

跨模型实验表明,学生模型稳定继承教师行为特征的情形,主要发生在师生双方共享相同初始化或基础模型高度匹配的配置中。在大多数异质模型组合下,未观察到特征的系统性传递

正文指出,GPT-4.1 与 GPT-4o 之间出现的偏好传递是少数例外之一,作者推测这可能源于二者在初始化阶段的潜在共性。上下文学习对照实验未能复现特征传递效应,这进一步支持了以下推断:该现象并非源于模型在上下文窗口内直接读取到语义线索,而是与更深层的初始化一致性或行为表征对齐有关
图10

Fig. 5 通过对比不同师生组合间的偏好传递强度,直观展示了传递效应对模型匹配程度的依赖关系

图11

省流总结

本研究表明,在特定的模型蒸馏条件下,学生模型能够从语义无关且经严格过滤的数据中继承教师模型的行为偏好乃至失配倾向。作者将这一现象命名为“阈下学习”,其发生高度依赖师生模型间的共享初始化或行为表征匹配。需要强调的是,当前结果并不能外推至任意模型与任意行为特征的普遍性传播,研究中亦未涉及对潜在防御策略的验证与评估

分享人:天天

审核:PsyBrain 脑心前沿编辑部

💡 关于我们

👋 你好,这里是「PsyBrain 脑心前沿」

🧠 专注追踪全球认知神经科学的最尖端突破

🔍 视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

📄 每日速递「深度解读」与「前沿快讯」

科研是一场探索未知的长跑,但你无需独行。欢迎加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

👇点击卡片进群,欢迎你的到来👇

图12

一键关注,点亮星标 ⭐ 前沿不走丢!

图13

图14

一键分享,让更多人了解前沿

预览时标签不可点

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图15

微信扫一扫可打开此内容,
使用完整服务

返回板块首页