Y015 Cell Rep Med | 清华团队发现:一段自我介绍,模型就能听到风险信号?结果令人震惊!
来源:公众号 PSY-Brain_Frontier | 发布:2026-05-30 | 原文链接

认知神经科学前沿文献分享
基本信息
Title: Integrating speech biomarkers and large language models for adolescent suicide risk detection with mobile application for real-world evaluation
发表时间: 2026-05-18
发表期刊: Cell Reports Medicine
影响因子: 10.6
获取原文:
-
添加小助手: PSY-Brain-Frontier 即可获取PDF版本
-
点击页面底部“阅读原文”跳转论文网页

研究背景
青少年自杀风险检测一直靠自评量表和临床访谈,但前者容易被报告意愿和污名化左右,后者又很吃专业资源
语音里的语调、停顿、说了什么、怎么说的,可能藏着额外线索。以前的研究大多用人工设计的声学特征,或者只做单一任务,很难同时处理声学和语义信息,也缺了从受控录音到真实手机场景的验证这一步
这项研究想问的是:把青少年自发语音里的声学和语义信息,通过大语言模型(large language models, LLMs)和语音编码器整合起来,能不能识别当前的自杀风险
实验设计与方法逻辑
研究纳入了10到18岁的青少年。开发队列有1,223人,来自46所学校;外部移动应用验证队列有450人,来自14所学校。
- 作者用儿童青少年迷你国际神经精神访谈(Mini International Neuropsychiatric Interview for Children and Adolescents, MINI-KID)的自杀模块和贝克自杀意念量表(Beck Scale for Suicide Ideation, BSS)来构建标签,比较了十类语音任务
- 模型这边,把传统声学特征加支持向量机、LLM few-shot、Wav2Vec 2.0加BERT这些基线,跟Whisper语音分支和Qwen文本分支拼起来的多模态融合(multimodal fusion)框架做了对比,最后把表现最好的自我介绍任务搬到移动应用语音里去验证
核心发现
发现一:自我介绍任务最能支持风险检测
十类语音任务里,开放式自我介绍在MINI-KID标签下拿到了最高的平均准确率,作者报告的投票集成结果是0.808
讨论里提到,开放式自我叙述更容易让人自我反思、表达情绪、自我披露,所以更适合捕捉跟风险有关的信号

Fig. 2 展示了不同方法在十类任务上的准确率比较。这个结果说明,任务形式本身会影响风险信号能不能被检测到
发现二:语音和文本融合比单一路径强
speech + text多模态模型在多数任务里都优于speech-only或text-only,自我介绍任务上的提升特别明显。这说明声学线索和转写文本里的语义线索有互补价值,但不能就此说模型已经搞懂了风险的因果机制

Fig. 3 比较了多模态和单模态输入。这个结果说明,声音表现和语言内容需要放在一起建模
发现三:手机真实场景验证还能保持一定性能
模型从受控录音换到移动应用采集的自我介绍语音后,性能掉了,但还在可用水平。MINI-KID标签下投票集成模型的准确率是0.779,macro-F1是0.719,说明真实录音的噪声确实会影响表现

Fig. 4 展示了移动应用外部验证的结果。这个结果说明真实采集是可行的,但不能等同于常规部署已经成熟
省流总结
这项研究显示,青少年的开放式自我介绍语音能给当前自杀风险筛查提供声学和语义线索,Whisper + Qwen多模态框架比多种基线要好,在手机采集场景里也能保留一定性能。边界也很清楚:模型输出只能当二次评估的触发信号,不能替代披露、访谈和安全流程
分享人:天天
审核:PsyBrain 脑心前沿编辑部
💡 关于我们
👋 你好,这里是「PsyBrain 脑心前沿」
🧠 专注追踪全球认知神经科学的最尖端突破
🔍 视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊
📄 每日速递「深度解读」与「前沿快讯」
科研是一场探索未知的长跑,但你无需独行。欢迎加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。
👇点击卡片进群,欢迎你的到来👇
一键关注,点亮星标 ⭐ 前沿不走丢!


一键分享,让更多人了解前沿
预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务

