A023 Sci adv | 从“声调到字词”:实时解码全谱普通话的脑机接口里程碑
来源:公众号 PSY-Brain_Frontier | 发布:2025-11-14 | 原文链接
PsyBrain 脑心前沿 | 公众号 PSY-Brain_Frontier
一键关注,点亮星标 ⭐️
不错过每日前沿资讯
认知神经科学前沿文献分享

基本信息
Title:Real-time decoding of full-spectrum Chinese using brain-computer interface
发表时间:2025.11.5
Journal:Science Advances
影响因子:12.5
获取原文:
- 后台回复“文献”即可获取PDF版本
- 点击页面底部“阅读原文”即可跳转论文原网页


引言
当“声调语言”遇上脑机接口——为什么中文更难
当一个人因渐冻症(ALS)、脑干卒中或肿瘤手术后失去发声能力时,语音型脑机接口(speech BCI)提供了一条充满希望的沟通之路:把大脑皮层的电活动直接翻译成文字或语音,绕过受损的口舌与声带。这条路在英语世界已跑出“实用级”样例:患者能够实时把想说的话变成屏幕上的句子或合成语音,重新参与家庭与社会互动。
可一到中文就“卡壳”了。原因不在工程师不够努力,而在于语言本体差异:
普通话是声调语言(tonal language),音高轮廓直接承载词义;汉字又以单音节语素为主,同音字密度极高。英语里,哪怕音素错几个,语言模型还能“猜回来”;普通话里,一个音节或声调偏差,常常就落到另一个完全合法且意思不同的字,语言模型的“补救空间”很小。


这让中文 BCI 对解码精度的要求陡增,尤其是在要真正帮助患者的实时系统里,更是需要“接近不犯错”的稳定性。这项工作提出一个非常“中文本位”的思路:把“音节(含声调)”作为脑内解码的中间单元,而不是像英语那样先解码音素。道理很朴素也很有效:
1、音节更稳定也更有意义,比音素更能抗小错误的扰动;
2、类目规模可控(普通话约 418 个基音节、考虑四声约 1298 个调类音节),适合直接从神经信号做模式识别;
3、从“调类音节”映射到汉字,再由轻量语言模型做句子级决策,等于把难题拆小、把不确定性锁死在更小空间里。
为验证这条路线,作者在一位接受癫痫术前评估的女性受试者脑表(ECoG)上植入256 通道高密柔性电极阵列,覆盖中/上颞回与腹侧感觉运动皮层(vSMC)等言语相关区,设计了两类任务:单字音节朗读(用来训练覆盖全谱的音节+声调解码器)和句子朗读(用来在线测试“音节→汉字→句子”的级联能力)。神经特征采用70–170 Hz 高伽马(high-γ),50 ms 滑窗、10 ms 步进实时处理;系统检测到起始后,截取−300~+700 ms神经片段,送入双流解码器**(一条流解音节,一条流解声调),再匹配候选汉字,最后由3-gram 语言模型+束搜索产出句子。

结果相当亮眼:394 个不同音节的离线中位准确率 71.2%;在线句子测试中,纯神经端 61.5%,加语言模型到 73.1%,通信速率 49.7 字/分钟,并串联出机械臂控制、虚拟人发声、与大模型互动等“功能性”演示。这些数字意味着:中文的“用脑说话”真的能跑起来了,而且不是演示一两个词,而是覆盖全谱音节、连成完整句子的那种跑起来。

省流总结
研究问题:普通话声调语言低冗余+高同音导致语音BCI解码难;如何实现全谱音节(含声调)的实时脑解码?
核心方法:在256通道高密ECoG上,构建双流(音节流+声调流)LSTM解码器,以音节为中间单位并与3-gram语言模型级联到汉字/句子。
主要成果:离线394音节中位准确率71.2%;实时句子CAR=73.1%(含LM),49.7 CPM;完成机器人/虚拟人/LLM控制演示。
意义:证明“音节(含声调)直解”是适配普通话的有效路径,为声调语言的通用语音神经假体奠定技术与实验范式。

研究背景
过往英语BCI多以音素/发音运动学为单位,依靠冗余度与强语言模型实现句子级输出;但普通话结构特性不同:声调承载词义、单音节为主、同音字密度高,使得传统“音素先行”的链路在错误传播与语义歧义上风险巨大。此外,普通话合法音节集合小而闭合(≈418基音节→≈1298调类音节),类别“有限可枚举”这一语言学属性反而提示了另一条路:直接把“音节(含声调)”作为脑内分类目标,再以字典映射与轻量语言模型完成至汉字与句子的过渡,从而在鲁棒性、可扩展性与实时性上取得平衡。作者据此提出“双流并行”的神经解码架构:一条流解音节,一条流解声调,随后融合成“调类音节”并映射到候选汉字,最终由3-gram语言模型+束搜索选出最可能的字序列,完成实时句子输出。这一设计兼顾脑信号的可分性(vSMC对不同音节有区分性高伽马图样)与语言系统的组合效率(有限音节→大量汉字),针对普通话的结构性瓶颈给出语言学与神经生理双重对齐的解决方案。

实验设计
受试者为一名 43 岁右利手女性,在临床癫痫定位过程中植入256 通道柔性 ECoG 阵列,覆盖中/上颞回、vSMC 与部分额下回。
作者先用单字音节朗读搭建训练集:从《现代汉语词典》列出 418 个音节,经被试熟悉度筛到 394 个,每个音节选一个她能读的汉字作为刺激;随后用句子朗读(2–11 字,词间有停顿)做在线评估与微调。在线以每 10 ms 滚动处理信号,在 50 ms 窗内提取 70–170 Hz 高伽马;检测到起始后取 −300~+700 ms 的片段,送入双流四层 LSTM:一条输出音节概率,一条输出声调概率。二者融合成调类音节,经“音节→汉字”字典生成候选字,再用3-gram 语言模型+束搜索给出最可能的字序列作为输出。离线阶段做10 折交叉验证与模型对比(CNN-LSTM、ViT、堆叠 LSTM);在线阶段在第 11 天进行实时句子测试,并把输出接入机械臂、数字虚拟人、LLM的人机界面以验证功能性沟通与控制。

Fig. 1. Framework of a real-time BCI for decoding Chinese sentences.

核心发现
发现一|vSMC 里,“音节+声调”有清晰可分的神经指纹
论文在 vSMC 找到对不同音节/声调有显著区分力的电极,且这些电极的平均高伽马活动在“你/穿/我/好/不”等音节上呈现不同的时间-频谱轮廓,反映出发音动作学差异(如起始辅音的部位/方式)。这说明中文的“音节整体方案”在大脑里并非简单音素叠加,而是可被机器学习直接分辨的整体图样。更关键的是,尽管覆盖未特意命中 LMC,声调的中位解码准确率仍达 69.1%,显著高于 25% 的机会水平。这一结果从神经生理层面支撑了作者的“双流并行”策略:音节流捕捉构音模式,声调流捕捉音高控制,两者融合在调类音节层面即可产生对汉字映射足够有用的线索,减少上层语言模型的“瞎猜”空间。

Fig. 2. Uniqueness of Chinese and cortical electrodes distinguishing Chinese syllables and tones.
发现二|四层 LSTM 的“全谱音节”解码:71.2%,且对词表规模和样本量都很稳
作者比较了 CNN-LSTM、ViT 与堆叠 LSTM(四层)三种架构。在 394 类的全谱集合上,堆叠 LSTM拿到中位 71.2%(10 折),显著优于其他两者。样本量敏感性分析同样给出“工程参考线”:每个音节从 5 次重复增至 20 次时,准确率从约 20.4%→55.6%;而当音节类目从 50 扩到 350 时,准确率仅小幅下降,显示系统具备大词表扩展弹性。这两条一起把“怎么训更划算”说清楚:同类增样本最见效;在可用时长内,优先确保每类重复,系统就能比较稳地扩到更全的音节覆盖。

Fig. 3. Offline performance of syllable and tone decoding.
发现三|把“调类音节”级联到“汉字→句子”,语言模型把在线 CAR 从 61.5% 拉到 73.1%
在线句子测试的关键对比是:仅神经端即可达 CAR=61.5%;加入3-gram 语言模型+束搜索后,CAR=73.1%;通信速率 49.7 CPM。实现上,系统先用音节流+声调流输出的概率去查“音节→汉字”的候选列表,再把神经似然与语言先验合并,沿束搜索输出最可能的字序列。这样做的妙处是:语言模型不再在“所有汉字”的超级大空间里瞎跑,而是在神经端“圈定的候选子空间”里做精细选择,既减歧义又抗小错,特别契合中文的高同音特性。这一步让“能读对音节的大多数”真正转化成“能读对汉字的多数”,也就有了在机械臂/虚拟人/LLM等真实互动里“说得清、用得上”的基础。
发现四|从“实验室数字”到“能用起来”:机械臂、虚拟人、LLM 的功能性演示
作者把实时解码系统接到一个简洁的人机界面:被试通过解码出的字符在界面上选功能并下达指令。演示结果里,机械臂控制达到 CAR=78.3%、完整指令命中率 54%(按 1–3 字指令、要求全字匹配计算);数字虚拟人语音合成场景 76.9%;与大语言模型互动 65.4%。这些不是“离线回放”,而是在第 11 天实时环节上跑出的功能闭环,证明这条“音节→汉字→应用”的链路已具可用雏形。虽然当天因时间限制,起始检测用的是音频而非神经,但作者在后续分析中补上了神经起始检测并验证在内在言语(不出声)情况下也可靠,为真正静默交流打下基础。

Fig. 4. Real-time speech decoding and speech-based BCI for controlling multiple software and hardware systems.

结论
这项工作以“音节(含声调)为解码单位”攻克了中文语音BCI的关键短板,实现覆盖394音节的实时系统,并把在线句级CAR提升至73.1%、通信速率接近50字/分,在单受试者条件下已显示出面向功能性沟通的潜力。
其电极—功能对应与双流结构共同说明:中文语音的声学—发音—语言三层信息可被稳定地分层提取与融合,为声调语言的神经解码提供了可复制的工程蓝本。

展望与应用
未来值得追问的方向:
跨被试泛化与基础模型:将多被试数据映射到标准脑模板,结合解剖先验做迁移学习,以缩短个体训练时间、提升泛化。
多模态融合:结合EMG/MEG/面部图像/口形视频等辅助信号,在自然场景下提升稳健性与速率。
无线、长期植入:向全植入无线ECoG过渡,减少感染风险、延长记录时长,利于纵向数据积累与模型迭代。
从运动到语言更高层:纳入语义/句法相关的高阶语言区(如颞/顶/额叶网络),实现更稳健的句级/篇章级理解与输出。
开放词表与应用生态:在开放语料上训练更强语言模型,面向日常沟通与智能体控制构建可扩展插件生态(Fig.4A所示多插件架构)。

文章作者信息
第一作者:Youkun Qian
复旦大学附属华山医院 神经外科 / 上海临床与转化脑机接口重点实验室 / 神经疾病国家中心(中国·上海)
Changjiang Liu
中国科学院上海微系统与信息技术研究所 2020 X-lab / 中国科学院大学(中国·上海/北京)
通讯作者:Jinsong Wu
复旦大学附属华山医院 神经外科等(中国·上海)
邮箱:wujinsong@huashan.org.cn
Zhitao Zhou
中国科学院上海微系统与信息技术研究所 / 中国科学院大学集成电路学院(中国·上海/北京)
邮箱:ztzhou@mail.sim.ac.cn
期刊引文信息:Sci. Adv. 11, eadz9968 (2025);出版日期:2025-11-05。
DOI:10.1126/sciadv.adz9968。

Abstract
Speech brain-computer interfaces (BCIs) offer a promising means to provide functional communication capacity for patients with anarthria caused by neurological conditions such as amyotrophic lateral sclerosis (ALS) or brainstem stroke. Current speech decoding research has predominantly focused on English using phoneme-driven architectures, whereas real-time decoding of tonal monosyllabic languages such as Mandarin Chinese remains a major challenge. This study demonstrates a real-time Mandarin speech BCI that decodes monosyllabic units directly from neural signals. Using the 256-channel microelectrocorticographic BCI, we achieved robust decoding of a comprehensive set of 394 distinct syllables based purely on neural signals, yielding median syllable identification accuracy of 71.2% in a single-character reading task. Leveraging this high-performing syllable decoder, we further demonstrated real-time sentence decoding. Our findings demonstrate the efficacy of a tonally integrated, direct syllable neural decoding approach for Mandarin Chinese, paving the way for full-coverage systems in tonal monosyllabic languages.

相关阅读
周报-20251006 | 近两周解读的29篇顶刊论文汇总 | 认知神经科学前沿动态 ⭐️[解读链接]
周报-20250922 |认知神经科学前沿动态周览 *⭐️[解读链接]***
周报-20251020|认知神经科学前沿动态周览**⭐️[ 解读链接 ]****
Nature |决策过程的动力学机制与神经模式转变 ⭐️[解读链接]
Nature |颠覆认知 ! “神经振荡”不成立?耶鲁团队提出大脑“伽马事件”新理论 ⭐️[解读链接]
Science |中国将领衔未来25年全球脑计划,剑指灵长类大脑地图 *⭐️[解读链接]***
Neuron |大脑如何区分现实与想象?伦敦大学学院团队最新研究揭秘“现实信号”的神经密码 ⭐️[解读链接]
Nature | 视觉系统新发现:压缩式的物体识别机制 ⭐️[解读链接]
Nat Hum Behav|你不是天生就爱跟风:社会特征学习理论揭示人类“随大流”背后的秘密 *⭐️[解读链接]***
Nature |“读心术”成真?从瞳孔变化中解码大脑皮层完整时空动态 ⭐️[解读链接]
PNAS|刷短视频停不下来?研究揭示“新奇感”是驱动人类探索的古老密码 *⭐️[解读链接]***
Neuron | 最强脑发育数据库RBC开放下载,6000+青少年大脑数据揭示精神健康的秘密 ⭐️[解读链接]
Nature 子刊综述|大脑预测误差的核心回路 *⭐️[解读链接]***
前沿交流 | 欢迎加入认知神经科学前沿交流群!⭐️[解读链接]

核心图表、方法细节、统计结果与讨论见原文及其拓展数据。
分享人:BQ
审核:PsyBrain 脑心前沿编辑部

PsyBrain 脑心前沿
带你了解心理学、脑科学的前沿知识与技术流程
预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务