P059 J Neurosci | 为什么有些旋律一听就“对拍”:EEG揭示音高与节奏的协同预测
来源:公众号 PSY-Brain_Frontier | 发布:2026-02-09 | 原文链接
PsyBrain 脑心前沿 | 公众号 PSY-Brain_Frontier
一键关注,点亮星标 ⭐️
第一时间接收每日前沿资讯
🧠 PsyBrain · 寒假提升计划 💪
你是否经历过这样的时刻:面对海量的 sMRI、fMRI 或 EEG 数据,不知从何下手构建 Pipeline? 为了跑通一个模型,在 GitHub 和论坛之间反复横跳,甚至和 AI 纠缠半天却依然报错? 明明有着绝佳的实验结果,却不知道怎么画脑袋,更不知道论文里那些漂亮的 🧠 是怎么来…
数据分析原理、实践与可视化本该是通往真理的桥梁,但往往成为阻碍你探索科学的高墙。
今年,我们联手国内顶尖名校博士和资深硕博生为你打造了一套认知神经科学全栈工具箱。从经典的sMRI、fMRI、dMRI、EEG/MEG,到硬核的 电生理、脑机接口,再到前沿的 RSA、MVPA、强化学习、认知建模、大语言模型,我们一站式配齐,欢迎查看~
课程时间 2026年2月24-28日,部分开设在3月初,报名截止 2026年2月17日。
考虑到报名人数和授课老师的时间安排,仍开设的课程如下,欢迎垂询~
报名截止 8 天倒计时~ 报名截止倒计时十天 | 面向心理学、认知神经科学同学的寒假提升班
认知神经科学前沿文献分享

基本信息:
Title:Chimeric Music Reveals an Interaction of Pitch and Time in Electrophysiological Signatures of Music Encoding
发表时间:2026.1.28
Journal:The Journal of Neuroscience
影响因子:4.0
获取原文:
- *添加小助手:*PSY-Brain-Frontier即可获取PDF版本
- 点击页面底部“阅读原文”即可跳转论文原网页


引言
听一段旋律时,我们往往能“预感”下一音会落在哪里:该升高还是回到主音?该在强拍落下还是延后一点制造律动?这种对后续音符的预测,来自我们长期接触音乐后形成的统计学习(statistical learning):大脑会根据上下文,估计下一个音的概率,并在“出乎意料”时产生更强的处理负荷。
过去很多EEG研究用时间响应函数(temporal response function, TRF)把连续脑电与音乐特征对应起来,并借助信息动力学音乐模型(Information Dynamics of Music, IDyOM)量化音符层面的期待,如惊讶度(surprisal)与不确定性(entropy)。但一个关键难题始终存在:自然音乐里音高(pitch)与时间/节奏(time/rhythm)高度耦合,IDyOM又主要分别建模两条序列,很难回答“音高与时间会不会在大脑里相互影响、共同塑造期待与节拍感?”
这篇论文用一种很“狠”的操作把两条维度拆开:把一首曲子的音高轮廓与另一首曲子的音符起始时间互换,做成“嵌合音乐”(chimeric music)。在保留各自边缘统计特征的同时破坏它们的天然绑定,作者由此得以直接观察:当音高—时间的配对规则被打乱,期待编码与强拍(downbeat)感知会如何改变。

实验设计与方法逻辑
作者选取Essen民歌库的单声部旋律,将不同拍号组(如三拍 vs 二/四拍)配对后互换音高序列与起始时间序列生成嵌合音乐(共66首原曲与66首嵌合曲),27名受试者被动聆听并记录EEG;随后用TRF分别以声学特征与IDyOM计算的音高/时间惊讶度与熵(surprisal/entropy)预测脑电,比较原曲与嵌合曲的预测增益;并以音符起始与强拍相关的脉冲回归量构建强拍模型,检验节拍编码是否受到音高结构“加成”。


Figure 1. Overview of the research framework.

核心发现
期待编码始终在线,但“拆开后”效应变弱
在TRF里加入IDyOM期待特征后,原曲与嵌合曲的脑电预测准确度都提升(Fig.2b),说明即使旋律变得不“顺”,大脑仍在持续做期待计算;但以Δr衡量的“期待增益”在原曲更大(Fig.2d),提示音高—时间的正常绑定能放大期待机制的有效性。

音高与时间各自贡献期待,但合在一起更像“真正的旋律”
无论只放音高期待(AMp)还是只放时间期待(AMt),都能显著优于纯声学基线(Fig.2d);然而完整模型(AM)带来的增益最大,并且在嵌合条件下降幅更明显。这意味着大脑并非把两维完全独立相加,而是会利用它们的联动结构来形成更稳定的旋律预测。
强拍不是音量提示,而是“语境中的高亮”
所有音符力度被统一,但强拍音仍诱发额外的神经响应:在原曲中,强拍回归量(DBo)在约185 ms出现明显峰值/后续成分(Fig.3b),而音符起始本身呈典型P1/P2形态(Fig.3a)。在嵌合曲中,按时间定义的强拍(DBct)几乎复制了原曲DBo的形态(Fig.3d),说明大脑能从时间结构中抽取“这是强拍”的加工信号。

Figure 3. TRF weights in the downbeat encoding model for original music note onset
节拍主要由时间驱动,但音高结构会“推一把”
在嵌合曲里,仅继承“原来属于强拍的音高位置”的回归量(DBcp)并不显著(Fig.3e),单靠音高无法让大脑判定强拍;但当某音同时满足时间强拍与音高来源曲的强拍位置时,交互项(DBcpt)在约180 ms出现更强的P2增强(Fig.3f),表明音高结构能调制节拍加工。同时,脑干层面的听觉反应(ABR)在原曲与嵌合曲几乎一致(Fig.5),提示这种交互更像是皮层层面的音乐结构计算。

Figure 5. Grand-averaged ABR waveforms derived from original and chimeric music.

归纳总结和点评
这项工作用“嵌合音乐”把旋律的两条主轴——音高与时间——在不改变各自统计属性的前提下强行解耦,从而以很干净的对照证明:期待编码与强拍加工不仅各自依赖对应维度,更依赖两者的耦合关系。TRF+IDyOM让作者把“听音乐时大脑在预测什么”变成可量化、可比较的神经指标;而强拍模型进一步指出:节拍虽由时间定义,却会被音高结构放大。整体设计新颖、控制严谨,也为后续用MEG/源定位去追问“交互发生在何处、由哪些网络实现”打下了清晰的实验范式基础。

请打分
这篇刚刚登上 The Journal of Neuroscience 的研究,是否实至名归?我们邀请您作为“云审稿人”,一同品鉴。精读全文后,欢迎在匿名投票中打分,并在评论区分享您的深度见解。
前沿交流| 欢迎加入认知神经科学前沿交流群!
⭐️[加群链接]

核心图表、方法细节、统计结果与讨论见原文及其拓展数据。
分享人:BQ
审核:PsyBrain 脑心前沿编辑部
预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务