A029 PNAS | 大脑如何处理滔滔不绝的语音流?斯坦福团队最新研究揭示语言“分层动态编码”(HDC)的奥秘
来源:公众号 PSY-Brain_Frontier | 发布:2025-10-30 | 原文链接
PsyBrain 脑心前沿 | 公众号 PSY-Brain_Frontier
一键关注,点亮星标 ⭐️
不错过每日前沿资讯
认知神经科学前沿文献分享

基本信息
Title:Hierarchical dynamic coding coordinates speech comprehension in the human brain
发表时间:2025.10.17
Journal:PNAS
影响因子:9.1
获取原文:
- 后台回复“文献”即可获取PDF版本
- 点击页面底部“阅读原文”即可跳转论文原网页


引言:瀑布般的信息流,大脑如何接招?
想象一下,你正在收听一段语速飞快的播客,或者与一位滔滔不绝的朋友交谈。信息如瀑布般涌来,但你的大脑却能毫不费力地从中解析出音素、识别单词、构建句法,并最终理解其深层含义。这一切几乎是瞬时完成的。这背后隐藏着怎样的神经“算法”?
这个过程面临一个核心的计算挑战:大脑必须在两种看似矛盾的任务之间取得精妙的平衡。一方面,它需要维持(maintain)刚刚听到的信息,比如一个句子的开头,这样才能理解句末的词语如何与之构成完整的意义。另一方面,它又必须随着语音流的展开而持续更新(update)信息,处理每一个新出现的音节和单词 。
更棘手的是,这种维持与更新必须在不产生混乱的前提下进行。如果大脑处理新旧信息的方式过于简单,前后涌入的神经信号就可能相互重叠、彼此“打架”,造成所谓的“破坏性干扰”(destructive interference)。那么,大脑是如何在维持历史信息的同时,又能清晰地处理实时输入,从而实现流畅、鲁棒的语音理解的呢?
近期,发表于《美国国家科学院院刊》(PNAS)的一项研究为我们提供了一个革命性的答案。由Laura Gwilliams领导的团队提出了一个名为分层动态编码(Hierarchical Dynamic Coding, HDC)的全新计算模型,它优雅地解开了这个困扰神经科学家长久以来的谜题 。

省流总结
对于时间紧张的读者,以下是这项研究的核心思想:
- 核心问题: 语音流是连续且快速的。大脑必须“记住”刚听到的内容(维持),才能理解后面的内容;同时又要处理新涌入的声音(更新),且不能让新旧信息互相“打架”(干扰)。
- 解决方案:分层动态编码(HDC)。 大脑对每个语言特征(如一个音素或一个单词)的编码不是一张“静态照片”,而是一部“动态微电影”。也就是说,代表某个特定信息的神经活动模式会随着时间的推移而系统性地演变和变化。
- 精妙之处: 这部“微电影”的“播放速度”是分层的。处理音素等底层、快速变化的特征时,神经编码演变得快;处理句法、语义等高层、持续时间长的特征时,神经编码演变得慢。这种速度的匹配,使得相邻但不同的信息单元(如连续的音素或单词)在神经层面始终保持区分,完美地避免了“破坏性干扰”,最终实现了高效、鲁棒的语音理解 。


研究背景
静态语音编码的局限性
要理解HDC模型的突破性,我们首先需要了解此前的理论模型有何不足。传统观点,尤其是在功能性磁共振成像(fMRI)研究的启发下,常常隐含着一种“静态编码”的假设。这种观点认为,一个特定的语言特征(比如“名词”)对应着大脑某个区域一个相对稳定、不变的神经活动模式,即所谓的“一对一”映射关系 。
打个比方,这就像一台老式计算机,用一组完全固定的晶体管组合来表示字母“A”。只要“A”这个信息需要被处理,这组晶体管的状态就保持不变。然而,这种静态编码的观点在解释连续、快速的语音流时,会遇到一个致命的难题。
这个难题就是“破坏性干扰”,它也是催生新理论的关键驱动力。语音的速度极快,音素和单词接踵而至。神经处理并非瞬间完成,一个信息的表征必须在大脑中维持一定时间才能被有效利用(例如,将音素组合成单词)。如果大脑对单词“cat”的神经编码是一个持续300毫秒的固定模式,而紧随其后的单词“sat”在150毫秒后出现,那么这两个单词的神经活动模式将在时间上发生重叠。如果它们依赖相同或相似的神经元群体,其信号就会像两个在同一频率上广播的电台一样互相冲突、混淆,这就是破坏性干扰 。因此,连续语音的物理特性本身就决定了,一种有效的神经编码方案必须超越静态的局限。HDC模型中不断演变的神经模式,正是对这一根本性约束的直接而优雅的回应。
整合数十年的研究:从孤立现象到整体系统
在此之前,语言神经科学的研究主要沿着两条路径展开。一条以fMRI为代表,侧重于功能定位,即回答“什么脑区负责什么功能”;另一条以脑电图(EEG)及其事件相关电位(ERPs)为代表,如著名的N400(与语义相关)和P600(与句法相关)成分,侧重于时间动态,即回答“某个语言事件发生后,大脑在哪个时间点出现反应”。
这些研究取得了丰硕的成果,但往往像是在研究交响乐团中的单个乐手。例如,传统的ERP研究通过设计精巧的语言“错误”(如语义不通顺的句子)来诱发特定的脑电波,从而推断大脑的处理机制。这种方法虽然强大,但研究的是大脑对孤立事件的反应。
而本研究则代表了一种范式上的转变。研究者们不再满足于研究单个乐手,而是试图录下整场交响乐的演奏。他们采用自然听觉的实验范式,让被试聆听完整的故事,并利用机器学习方法同时解码一个包含54种不同语言特征的完整层级结构 。这种方法将研究框架从“刺激-反应”式转变为“连续追踪”式,不再问“这个语言错误引发了什么脑电波?”,而是问“在任何时刻,大脑是如何表征所有语言信息的?”。这标志着语言神经科学从研究孤立现象,迈向了理解一个整体、动态、协同工作的系统。

研究问题
基于上述背景,研究团队将他们的探索聚焦于三个逻辑清晰、层层递进的核心问题,旨在揭示大脑处理语言的深层运作机制:
- 并行处理还是流水线? 在我们听语音时,大脑是像工厂流水线一样,先处理完声音,再处理单词,最后处理语法吗?还是说,它能像一台强大的并行计算机一样,同时处理从音素到语义的所有层级的信息?
- 信息的“保质期”有多长? 大脑对不同语言信息的记忆时长是否不同?具体来说,一个底层音素的神经信号,是否会比一个高层句法结构的神经信号更快地消失?
- 编码是“静态照片”还是“动态电影”?一个单词的神经表征,在其被大脑处理的数百毫秒内,是保持不变的(静态),还是在不断变化的(动态)?如果它是动态的,其变化的速度是否与它所属的语言层级有关?

实验设计
实验设置:在脑磁图扫描仪中聆听故事
研究的核心实验招募了21名以英语为母语的被试。他们躺在脑磁图(MEG)扫描仪中,舒适地聆听了长达两小时的英文有声故事 。
选择MEG作为探测工具是关键所在。与fMRI擅长空间定位不同,MEG能够以毫秒级别的时间分辨率捕捉到神经元电流活动产生的微弱磁场。这种超高的时间精度对于追踪语音这种快速、动态的认知过程至关重要。
语言模型:将语言解构为六个层级
为了全面地考察大脑的语言处理过程,研究者们没有局限于单一维度的语言特征,而是建立了一个涵盖从感知到抽象的完整层级模型。他们从连续的语音流中提取了54个语言特征,并将它们归纳为六个层级:
- 音素特征 (Phonetic): 描述最基本的语音单位。例如,当前音素是否为鼻音(如/m/),是否为元音(如/a/)。
- 词形特征 (Word Form): 描述单词的物理构成。例如,一个单词包含多少个音素,多少个语素(最小的意义单位)。
- 词汇-句法特征 (Lexical-Syntactic): 描述单词的词性和使用频率。例如,这个词是名词还是动词,它在语料库中出现的频率高低。
- 句法操作 (Syntactic Operation): 描述句法结构的动态构建过程。例如,当前单词是否开启了一个新的句法节点(如短语的开始),或者是否关闭了一个节点。
- 句法状态 (Syntactic State): 描述当前时刻句法结构的全局状态。例如,当前单词在整个句子语法树中的深度。
- 语义特征 (Semantic): 描述单词的意义。研究者使用GloVe词向量模型来量化每个单词的语义信息。


Fig. 1. The hierarchical dynamic coding (HDC) hypothesis.
分析引擎:时间分辨解码与时间泛化
拥有了高时间分辨率的大脑活动数据和精细的语言特征标注后,研究者动用了一种强大的机器学习分析技术,即时间分辨解码(time-resolved decoding),尤其是其扩展方法——时间泛化(temporal generalization)。
时间分辨解码可以被比作训练一个“读心侦探”。在每一个时间点(例如,单词出现后的第100毫秒,第101毫秒……),研究者都会训练一个机器学习分类器。这个分类器的任务是学习在该特定时刻,全脑208个MEG传感器的信号模式(即大脑的磁场分布)与某个语言特征(例如,“这是一个名词”)之间的对应关系。如果在某个时间点,这个“侦探”的猜测准确率显著高于随机水平,就意味着大脑在该时刻确实编码了这一语言信息 。
时间泛化则将这一过程推向了更深的层次。它不仅要训练“侦探”,还要测试这位“侦探”的“时效性”。研究者会提出这样的问题:在第100毫秒训练出的能够识别“名词”信号的侦探,能否成功地在第400毫秒时也识别出“名词”的信号? 这种跨时间的测试揭示了神经表征的动态本质:
- 如果神经编码是静态的(“静态照片”),那么第100毫秒的“名词”信号模式和第400毫秒的应该基本相同。这样,在100毫秒训练的“侦探”在400毫秒也能成功解码。在最终的时间泛化矩阵图上,这将形成一个实心的“正方形”区域,表示解码器在很长一段时间内都具备泛化能力 。
- 如果神经编码是动态的(“动态电影”),那么第400毫秒的“名词”信号模式已经和100毫秒时完全不同了。这样,100毫秒的“侦探”就无法在400毫秒时工作。成功的解码只会发生在训练时间和测试时间非常接近的时候。在矩阵图上,这将形成一条狭窄的“对角线”。
这项技术的精妙之处在于,它能够将一个神经表征的内容(content)与其格式(format)区分开来。常规的时间分辨解码只能回答:“关于‘名词’的信息是否存在于此刻的大脑信号中?” 而时间泛化则能回答一个更深层的问题:“大脑在X时刻表征‘名词’的方式,和它在Y时刻表征‘名词’的方式是否相同?” 研究结果表明,对于第一个问题,答案在很长一段时间内都是“是”(信息内容存在);但对于第二个问题,答案却是“否”(信息格式在变化)。这意味着大脑并非在记忆中持有一个静态的“文件”,而是在主动地将一个信息包通过一系列不同的神经元组合进行传递和处理。这正是动态过程的本质,也是该研究方法论上的巨大飞跃。

Fig. 2. Methods.

核心发现
💡发现一:大脑是一部强大的并行处理器,且高层信息“待机时间”更长
首先,研究结果有力地证明,大脑在处理语言时并非简单的流水线作业。数据显示,在一个显著的时间窗口内(大约在单词结束前的40毫秒到结束后的230毫秒之间),从音素特征到语义特征,所有六个层级的语言信息都可以被同时解码 。这表明大脑是一个高效的并行处理器。

Fig. 3. Feature decoding time courses.
更有趣的是,不同层级信息的“保质期”或“待机时间”存在显著差异。解码结果显示,信息在大脑中可被追踪的时长,与其在语言层级中的位置呈正相关 :
- 音素特征的表征持续时间最短,约270毫秒。
- 词形特征的持续时间居中,约680毫秒。
- 句法和语义特征的表征持续时间最长,超过1200毫秒(1.2秒),这意味着当大脑还在处理后面好几个词时,前面某个词的句法和语义信息依然处于活跃状态。
然而,最令人意外的发现来自于这些信息解码的起始时间。一个纯粹“自下而上”(声音→单词→意义)的加工模型会预测,音素解码应该最先开始,然后是词汇,最后是句法和语义。但数据显示的却是相反的趋势:高层级的语义和句法信息,其解码的起始时间甚至早于一些底层的音素特征,有时甚至在单词的声音信号完全呈现之前就可以被探测到 。
从生物学上讲,如果大脑只是被动地等待输入,这是不可能实现的。唯一合理的解释是,大脑是一个主动的预测引擎。它利用故事的前后语境来预测接下来最可能出现的词语类型。在听到声音之前,大脑就已经预先激活了一片与预测相关的语义和句法特征“云”。随后到来的声音信号,起到的作用更像是验证或修正这些自上而下的预测。这一反直觉的发现,为语言理解的预测编码理论(predictive coding)提供了强有力的神经证据。

Fig. 4. Decoding hierarchical features.
💡发现二:神经编码是动态的“电影”,而非静态的“照片”
对于第二个研究问题,时间泛化分析提供了决定性的证据。分析结果显示,对于所有六个语言层级,从音素到语义,时间泛化矩阵无一例外地呈现出清晰、显著的对角线模式 。
这就像找到了案件的“确凿证据”,直接证实了所有类型的语言特征都是通过一种动态的神经编码方案来表征的。代表某个特定信息的大脑活动模式,在其被处理的整个生命周期中,都在经历着系统性的、连续的演变。“静态编码”的假设,至少在语音理解领域,被这项研究有力地驳斥了。

Fig. 5. Evidence for HDC.
💡发现三:“电影”的播放速度因“剧情”复杂度而异
这项研究最深刻的发现,在于揭示了这种动态编码的内在组织规律。动态编码这部“电影”的“播放速度”——即神经模式演变的速度,并非一成不变,而是与信息所处的语言层级精准匹配。
时间泛化矩阵对角线的“宽度”反映了神经模式的稳定性(即一个解码器能够泛化的时间窗口)。结果显示:
- 音素特征的神经编码演变得最快,其模式的稳定时间仅为约64毫秒。
- 词汇特征的演变速度居中,稳定时间约为224毫秒。
- 句法特征的神经编码演变得最慢,稳定时间长达约720毫秒。
这种速度上的分层调节,展现了一个为效率而高度优化的系统。我们可以从语言单位自身的时间尺度来理解其功能意义。音素在话语中转瞬即逝(几十毫秒),单词持续时间稍长(数百毫秒),而短语和句子则在数秒的时间尺度上展开。
对于音素这种快速序列(如c-a-t),一个快速演变的编码是必需的,这样才能确保对“c”的表征不会“泄漏”并干扰到紧随其后的“a”。相反,对于句法结构,一个缓慢演变的编码则是必要的,因为大脑需要在一个稳定的表征框架下,跨越多个单词来整合信息,从而正确理解它们之间的依存关系。
大脑完美地将神经编码的时间动态,与它所要表征的信息的统计特性相匹配。这并非巧合,而是一个经过长期演化、为实现高效信息处理而精心设计的标志。动态的特性解决了“更新”的问题,而分层的速度调节则以一种资源节约的方式,同时解决了“维持”和“避免干扰”这两大难题。

Fig. 6. Simulating empirical results.

编辑部观点
语言神经科学的“动态时代”已经来临
Gwilliams及其同事提出的分层动态编码(HDC)模型,不仅仅是对一系列实验现象的总结,它更提供了一个统一的计算框架,完美地解决了语言处理中“维持 vs. 更新”的核心悖论。它解释了大脑如何能够既稳定地在时间长河中构建意义,又灵活地处理源源不断的信息流。可以说,HDC为我们描绘了一幅关于大脑语言“操作系统”的全新蓝图。
这项研究的深远意义在于,它推动了认知神经科学领域一次重要的范式转型。在过去很长一段时间里,尤其是在fMRI技术兴起之后,神经科学的许多工作都聚焦于功能定位——绘制一幅大脑功能的静态“地图”,例如找到所谓的“语言区”、“面孔区”等。
然而,这项研究雄辩地证明,对于像语言这样高度动态的过程,“在哪里”和“在何时”是密不可分的。关键信息并非蕴含在一个固定的脑区位置,而是存在于神经活动在空间和时间上展开的完整轨迹之中——这更像是一部“电影”,而非一张“地图”。这迫使我们重新思考“神经表征”的本质:它不是一个静止的状态,而是一个持续演变的过程。这一观念的转变,对于我们研究从记忆到决策等所有高级认知功能,都具有极其深刻的启示。
更令人着迷的是,HDC模型揭示的生物智能原理,与当前最前沿的人工智能技术产生了惊人的共鸣。研究者在论文中明确指出,他们发现的动态编码机制,与现代大型语言模型(如GPT系列)中使用的旋转位置编码(Rotary Position Embedding, RoPE)等技术在概念上非常相似 。
无论是人脑还是大型语言模型,都面临着一个共同的根本问题:如何处理序列数据,并有效追踪其中元素的位置和顺序信息。Transformer模型通过位置编码赋予模型对序列顺序的感知能力,而RoPE正是一种通过动态旋转表征来实现这一目标的巧妙方法。
生物演化与人工智能研究,为了解决同一个序列处理难题,最终不约而同地走向了相似的解决方案——利用不断演变的表征格式来编码时间信息。这一趋同现象或许暗示着,这可能是一种处理序列信息的“范式计算”(canonical computation),即一种根本性的、高效的通用解决方案。这项研究不仅照亮了人类大脑的运作方式,更在生物智能与人工智能之间架起了一座引人入胜的桥梁。
总而言之,Gwilliams等人的工作没有停留在回答旧问题,而是为我们开启了探索新问题的广阔疆域。在这个动态的神经活动级联中,信息究竟是如何被转化的?在语言学习过程中,这个系统又是如何建立和调整的?通过提供一个全新的模型和一套强大的分析工具,这项研究无疑为未来十年的语言神经科学奠定了坚实的基础。

Author information
第一作者兼通讯作者:Laura Gwilliams
Department of Psychology, Stanford University, Stanford, CA 94305
美国加利福尼亚州,斯坦福大学心理学系
Wu Tsai Neurosciences Institute, Stanford University, Stanford, CA 94305
美国加利福尼亚州,斯坦福大学吴蔡神经科学研究所
Stanford Data Science, Stanford University, Stanford, CA 94305
美国加利福尼亚州,斯坦福大学数据科学中心

Abstract
Speech comprehension involves transforming an acoustic waveform into meaning. To do so, the human brain generates a hierarchy of features that converts the sensory input into increasingly abstract language properties. However, little is known about how rapid incoming sequences of hierarchical features are continuously coordinated. Here, we propose that each language feature is supported by a dynamic neural code, which represents the sequence history of hierarchical features in parallel. To test this “hierarchical dynamic coding” (HDC) hypothesis, we use time-resolved decoding of brain activity to track the construction, maintenance, and update of a comprehensive hierarchy of language features spanning phonetic, word form, lexical–syntactic, syntactic, and semantic representations. For this, we recorded 21 native English participants with magnetoencephalography (MEG), while they listened to two hours of short stories in English. Our analyses reveal three main findings. First, the brain represents and simultaneously maintains a sequence of hierarchical features. Second, the duration of these representations depends on their level in the language hierarchy. Third, each representation is maintained by a dynamic neural code, which evolves at a speed commensurate with its corresponding linguistic level. This HDC preserves the maintenance of information over time while limiting destructive interference between successive features. Overall, HDC reveals how the human brain maintains and updates the continuously unfolding language hierarchy during natural speech comprehension, thereby anchoring linguistic theories to their biological implementations.

推荐相关阅读
周报-20251006 | 近两周解读的29篇顶刊论文汇总 | 认知神经科学前沿动态 ⭐️[解读链接]
周边-20250922 |认知神经科学前沿动态周览 *⭐️[解读链接]***
Nature |决策过程的动力学机制与神经模式转变 ⭐️[解读链接]
Nature |颠覆认知 ! “神经振荡”不成立?耶鲁团队提出大脑“伽马事件”新理论 ⭐️[解读链接]
Science |中国将领衔未来25年全球脑计划,剑指灵长类大脑地图 *⭐️[解读链接]***
Neuron |大脑如何区分现实与想象?伦敦大学学院团队最新研究揭秘“现实信号”的神经密码 ⭐️[解读链接]
Nature | 视觉系统新发现:压缩式的物体识别机制 ⭐️[解读链接]
Nat Hum Behav|你不是天生就爱跟风:社会特征学习理论揭示人类“随大流”背后的秘密 *⭐️[解读链接]***
Nature |“读心术”成真?从瞳孔变化中解码大脑皮层完整时空动态 ⭐️[解读链接]
PNAS|刷短视频停不下来?研究揭示“新奇感”是驱动人类探索的古老密码 *⭐️[解读链接]***
Neuron | 最强脑发育数据库RBC开放下载,6000+青少年大脑数据揭示精神健康的秘密 ⭐️[解读链接]
Nature 子刊综述|大脑预测误差的核心回路 *⭐️[解读链接]***
前沿交流 | 欢迎加入认知神经科学前沿交流群!⭐️[解读链接]

本文解读基于:Hierarchical dynamic coding coordinates speech comprehension in the human brain,Doi:10.1073/pnas.2422097122。核心图表、方法细节、统计结果与讨论见原文及其拓展数据。点击左下角 “阅读原文” 可跳转到论文源网站界面。
分享人:饭哥
审核:PsyBrain 脑心前沿编辑部

PsyBrain 脑心前沿
带你了解心理学、脑科学的前沿知识与技术流程
预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务