🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / 语言与阅读:顶刊文献解读专题 / A · 文献解读 / A005 · PNAS:迭代学习怎样把“语言”推向组合结构?深度线性网

A005 PNAS:迭代学习怎样把“语言”推向组合结构?深度线性网络给出可解析答案

来源:公众号 PSY-Brain_Frontier | 发布:2026-05-13 | 原文链接

图1

认知神经科学前沿文献分享

图2

基本信息

Title: Compositionality and systematicity emerge from iterated learning in deep linear networks

发表时间: 2026-05-05

发表期刊:PNAS

获取原文:

  1. 添加小助手: PSY-Brain-Frontier 即可获取PDF版本

  2. 点击页面底部“阅读原文”跳转论文网页

图3

图4

引言

人类语言最令人着迷的一点,是它不仅能记住既有表达,还能把已有成分重新组合,用来处理从未直接遇到过的新情境。理解过“brown dog”和“black cat”的人,通常也能顺势理解“brown cat”;这种能力常被称为系统性泛化。它的关键不在于样本记得多,而在于是否抓住了可重复利用的结构。正因为如此,语言中的组合性长期既是认知科学关心的问题,也是机器学习试图接近的能力目标。

围绕语言结构如何形成,一个影响深远的解释是迭代学习(iterated learning, IL):语言不是一次定型,而是在一代代学习者之间传递时,被逐步压缩、重组,并朝更容易学习的方向演化。经典行为实验已经表明,人工语言在代际传递后往往会变得更规则;但如果没有足够的表达压力,它又可能过度简化,最后失去区分不同意义的能力。因此,真正值得解释的不是“语言会不会变简单”,而是它如何在规则性与表达性之间取得平衡,并在这个过程中形成可复用的组合结构。

不过,既有关于迭代学习的工作,多数来自贝叶斯模型、人工语言实验或经验性神经网络研究。这些研究能说明某些结构会出现,却较少直接回答:当学习者是依靠梯度下降训练的神经网络时,哪些模式会先学到,哪些会在代际中保留,哪些又会被逐渐遗忘。更具体地说,两个问题一直缺少严格刻画:第一,网络深度是否真的会改变迭代学习的结果;第二,多代传递是否不可替代,还是说在单代训练里找到一个理想早停点,也能得到类似效果。

图5

实验设计与方法逻辑

这项研究是理论推导结合数值模拟,而非生物实验或常规基准测试。作者先分析浅层线性网络,令网络学习从输入意义 (X) 到输出信号 (Y) 的映射,并用全批量梯度下降最小化二次损失;借助输入相关矩阵与输入—输出相关矩阵的奇异值分解,得到各模式随训练时间变化的闭式表达。随后把“每一代只训练有限步,再把该代输出交给下一代”形式化为迭代学习过程。

在此基础上,作者引入深层线性网络,考察深度如何改变模式学习的时间顺序。为讨论组合性与系统性,论文构造了同时含有组合性输入/输出与非组合性输入/输出的数据空间,并用秩-基数比(Rank-Cardinality Ratio, RCR)刻画规则性与表达性的平衡。

图6

核心发现

发现一:深度为迭代学习提供了“选择性遗忘”的动力学前提

论文首先回答的是:为什么同样是迭代学习,浅层与深层网络会走向不同结果。对浅层线性网络,作者从 Eq. 3 推出,各模式都会以指数形式同时向各自稳态推进;这意味着一旦每代训练都提前终止,所有模式都会一起变弱,网络并不能只删去“多余结构”,而是会把整套映射整体冲淡。Fig. 1 给出了这种“代际传递—模式保留/遗忘”的概念框架,而 Fig. 2 更直接并排展示了深层与浅层网络在模式轨迹上的差异。

图7

Figure 1. The iterated learning procedure: Generations of agents learn to map meanings (X) to signals (Y ) generated by their parent, and pass on the meaning to signal examples to their children

图8

Figure 2. Analytical learning dynamics for deep (A and B) and shallow (C and D) linear networks

Fig. 2 的意义在于,它把“深度有帮助”具体落实为可观察的学习动力学:深层网络中的模式不是同步推进,而是呈现出分阶段、按强弱先后学习的特征;较快模式可以先稳定下来,较慢模式则仍停留在接近初始值的位置。正因为这种时间上的可分离性存在,迭代学习才可能在多代过程中保留前者、削弱后者。与之相对,浅层网络没有这种阶段分离,因此无法在不伤及其他模式的前提下有选择地移除某一类模式。

发现二:多代迭代学习通常不能被单代最优早停替代

在确认深度的重要性之后,论文进一步追问:既然深层网络本身具有分阶段学习性质,是否只需在单代训练中找到一个恰当停止点,就能达到与迭代学习类似的效果?作者给出的答案是否定的,并以 Theorem 2 明确指出:若想“有保证地”只移除目标模式而保留应维持的模式,多代过程是必要条件。原因在于,单代训练通常难以稳定落在那个理想窗口——既让目标模式尚未充分发展,又让需要保留的模式已经足够接近收敛。

Fig. 2 展示了深浅网络差异,也刻画了跨代递归后的累积效应。在深层网络中,一个在当前代被压低的慢模式,会在下一代变成更弱的教学信号,于是学习速度进一步下降;这种“越传越弱”的递归,会逐步拉大它与被保留模式之间的时间分离。换言之,迭代学习的核心不只是“训练得不够久”,而是代际传递本身在不断重塑下一代的可学习目标。正是在这个意义上,多代 IL 不是单代早停的重复版本,而是一种具有独立动力学后果的过程。

发现三:迭代学习优先保留低秩、可复用的输出结构,使语言在规则性与表达性之间达成平衡

论文的核心不只是“能删模式”,而是删掉之后剩下的是否更接近组合性语言。为此,作者设计了一个同时允许两种路线的数据空间:网络既可以依赖组合性成分去描述意义,也可以走“逐项记忆命名”的路线。Fig. 3 是理解这一设定的关键,它把输入 (X) 与输出 (Y) 都拆成组合性部分和非组合性部分;Fig. 1 则进一步说明,迭代学习理想的结果不是无限压缩,而是在尽量维持表达能力的前提下,减少映射所需的模式数,并降低秩-基数比 RCR。

在这一空间中,作者给出三类主要模式的奇异值排序,并指出最先被学习、也最容易跨代保留下来的,是与组合性子结构关系最紧密的低秩模式。结合 Fig. 2 的模式学习顺序,以及正文提及的 Fig. 4 对迭代学习后输出结构的对照,论文表明:代际传递并非随机遗忘,而是会偏向保留那些更易学习、可反复复用的输出结构。 图9

Figure 3. We schematize the setting with a space of datasets containing compositional (XΩ) and noncompositional (XΓ) components in the input meanings (Left panel)

图10

Figure 4. The final output signals from the IL algorithm (Left) for all meanings after removing modes 𝜋2 and 𝜋3 [comparable to the original output in Fig

图11

归纳总结和点评

这项工作的重要性,在于它没有停留在“迭代学习会让语言更有结构”的直觉层面,而是把这一命题拆解为可证明的学习动力学条件。作者清楚地表明:在深度线性网络中,深度使模式学习具备时间分离,多代传递则把这种分离放大,从而让输出映射朝更低秩、更规则且仍保有表达能力的方向演化。

更值得肯定的是,论文对“系统性”给出了边界清晰的拆分:迭代学习确实有助于提炼输出端的组合结构,但并不会自动解决输入端对非组合性特征的依赖。因此,这篇文章既为语言文化演化提供了一个可解析的神经网络机制,也提醒机器学习研究者:组合性与系统性不能只看输出是否规整,还要看模型是否真的学会了可泛化的输入结构。结论的适用范围仍受限于线性网络与特定数据空间,这也是后续走向更真实非线性模型时需要继续检验的地方。

···

图12

请打分

这篇刚刚登上 PNAS 的研究,是否实至名归?我们邀请您作为“云审稿人”,一同品鉴。精读全文后,欢迎在匿名投票中打分,并在评论区分享您的深度见解。

分享人:BQ

审核:PsyBrain 脑心前沿编辑部

💡 关于我们

👋 你好,这里是「PsyBrain 脑心前沿」

🧠 专注追踪全球认知神经科学的最尖端突破

🔍 视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

📄 每日速递「深度解读」与「前沿快讯」

科研是一场探索未知的长跑,但你无需独行。欢迎加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

👇点击卡片进群,欢迎你的到来👇

图13

一键关注,点亮星标 ⭐ 前沿不走丢!

图14

图15

图16

一键分享,让更多人了解前沿

预览时标签不可点

作者提示: 内容由AI生成

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图17

微信扫一扫可打开此内容,
使用完整服务

返回板块首页