🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / 科研分析:认知神经科学前沿的结构化精读 / P · 感知觉与注意 / P033 · TiCS综述灵长类大脑如何处理声音信息

P033 TiCS综述 | 灵长类大脑如何处理声音信息

来源:公众号 PSY-Brain_Frontier | 发布:2026-04-16 | 原文链接

图1

认知神经科学前沿文献分享

图2

基本信息

Title: Voice information processing by the primate brain

发表时间: 2026-02

发表期刊:Trends in Cognitive Sciences

获取原文:

  1. 添加小助手: PSY-Brain-Frontier 即可获取PDF版本

  2. 点击页面底部“阅读原文”跳转论文网页

图3

图4

引言

我们日常听到的声音,远不只是语言内容的载体。很多时候,在一句话尚未说完之前,大脑已经开始判断“是谁在说话”“此刻情绪如何”“这是不是熟悉的人”,甚至进一步推测说话者的意图与社会意义。正因如此,作者把声音称作听觉中的“面孔”,强调它和视觉中的面孔一样,都是高度浓缩、动态变化、却又极具社会信息密度的线索。

不过,相比语言和语音研究,神经科学对“声音本身如何被知觉和表征”的关注长期并不充分。过去相关证据分散在不同方法之中:功能磁共振成像(fMRI)揭示了声音选择性皮层区域,脑电和脑磁图追踪了声音加工的时间进程,猕猴和狨猴研究则把问题推进到进化层面。但这些发现往往彼此独立,导致领域内虽然已知道大脑会优先处理声音,却仍缺少一幅跨物种、跨尺度、跨方法的整合图景。尤其关键的问题仍待回答:这种声音选择性网络是否为灵长类共享特征;它到底多快开始把声音与非声音区分开来;身份、熟悉性和情绪等更高阶信息又是怎样逐步建立的。

这篇综述的重要性,就在于把原本零散的证据重新组织起来。作者综合人类与非人灵长类的 fMRI、颅内记录、单神经元研究以及近年的计算模型,试图说明声音加工并不是一组松散现象,而是一个具有相对稳定组织原则的系统。文章尤其强调三点:其一,灵长类可能共享一套进化保守的“声音斑块”系统;其二,声音与非声音的神经区分出现得比早期认识更快,而且更高阶社会信息会沿时间和层级逐步展开;其三,深度神经网络和潜在空间模型正在为理解“大脑如何把复杂声学输入转成稳定身份表征”提供新的计算语言。

图5

实验设计与方法逻辑

文章按照“网络定位—跨物种比较—时间动态—行为相关表征—计算模型”的逻辑整合既有研究。文章先梳理人类颞叶声音区(temporal voice areas, TVAs)及额叶声音区(frontal voice areas, FVAs),明确声音加工的核心与扩展网络;随后结合猕猴、狨猴的 fMRI 和单神经元记录,讨论声音斑块是否具有功能同源性。接着,作者汇总 EEG、MEG、立体脑电(sEEG)、皮层脑电(ECoG)和猕猴电生理,重建声音加工的快速时间展开。

图6

核心发现

发现一:灵长类存在可跨物种对照的声音选择性区块系统

这篇综述首先把一个关键事实讲清楚:声音选择性脑区并非人类独有。根据人类、猕猴和狨猴的 fMRI 证据,作者总结出灵长类次级听觉皮层内存在功能上可比较的“声音区块”系统。人类中,最稳定的核心网络是沿上颞回/上颞沟(STG/STS)分布的后部、中部和前部颞叶声音区;猕猴和狨猴也可见前部或分布式声音区块。Figure 1 上半部分之所以重要,就在于它把三类灵长类的相关脑区直接放在同一进化框架下展示,视觉上支撑了“功能同源”的主线。

图7

Figure 1. From voice-selectivity maps to neurons

发现二:声音与非声音的区分出现很早,并在时间上逐步展开到更高阶社会信息

文章对时间维度的整合,是另一条非常重要的主线。早期 EEG 曾把声音/非声音区分放在约 320 ms,但后续高密度 EEG 和 MEG 发现,额颞部与声音相关的正成分可在约 170 ms 出现,已接近视觉中面孔 N170 的时间尺度。更关键的是,Figure 1 下半部分把人类颅内高伽马活动与猕猴单神经元记录并置,显示声音类别信息可在更早的 30–150 ms 内被神经系统提取,人类部分电极甚至早于 50 ms。

发现三:声音网络会编码身份、熟悉性与情绪,且这些表征会被经验进一步塑形

在“是不是声音”之外,这套网络真正服务的是社会交流中的有用信息。Figure 2A 汇总的人类 fMRI 结果显示,说话者身份不仅能从双侧 TVA 的活动模式中解码,也涉及顶叶和左额下回等区域,说明身份信息并不局限于单一听觉斑块。Figure 2B 进一步显示,熟悉声音在神经表征空间中的区分度更高:个人熟悉的声音会招募更广泛的人物身份网络,包括颞极、缘上回、前岛叶和内侧额叶,并表现出更强的表征差异。
图8

Figure 2. Behaviourally relevant coding of voice identity across scales

发现四:计算模型提示声音身份表征可能依赖低维潜在空间与“流形解缠结”

这篇综述的理论整合,集中体现在对计算模型的讨论。作者指出,中部颞叶声音区(mTVA)的活动还可以较好地由基频、共振峰分散、谐噪比等声学维度解释,但到了前部 TVA,仅靠这些低层特征已不足以解释其表征性质,更需要引入对身份更稳定的抽象模型。Figure 3A 展示了自编码器、监督分类器和自监督模型如何把高维声音输入压缩为低维表示,这也是“声音潜在空间(voice latent space, VLS)”概念的核心意义。

图9

Figure 3. Modelling voice representations

图10

归纳总结和点评

这篇综述最突出的贡献,是把声音选择性脑区、跨物种证据、快速时间动态、身份与情绪编码以及深度神经网络建模,整合成了一条相对统一的研究叙事:灵长类大脑中存在进化上延续的声音加工系统,它能够在极短时间内提取声音这一社会信号,并沿听觉层级逐步形成更抽象、更稳定、也更接近行为需求的身份与情感表征。文章尤其有价值的地方,在于把“声音是听觉中的面孔”从一个形象比喻推进为可比较、可建模、可跨物种检验的科学框架。不过它也清楚保留了边界:现有证据虽支持声音斑块的跨物种连续性与层级化表征,但关于这些斑块究竟是离散模块还是连续梯度、关键区域在知觉中的必要因果作用为何、以及深度模型与真实神经实现之间能对应到什么程度,仍是需要后续实验回答的开放问题。

分享人:BQ

审核:PsyBrain 脑心前沿编辑部

💡 关于我们

👋 你好,这里是「PsyBrain 脑心前沿」

🧠 专注追踪全球认知神经科学的最尖端突破

🔍 视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

📄 每日速递「深度解读」与「前沿快讯」

科研是一场探索未知的长跑,但你无需独行。欢迎加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

👇点击卡片进群,欢迎你的到来👇

图11

一键关注,点亮星标 ⭐ 前沿不走丢!

图12

图13

一键分享,让更多人了解前沿

作者提醒:内容由AI生成

预览时标签不可点

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图14

微信扫一扫可打开此内容,
使用完整服务

返回板块首页