A044 CT影像的 Aha moment | Nature 报道多中心4.4w例验证集下稳健表现的大模型
来源:公众号 PSY-Brain_Frontier | 发布:2026-03-19 | 原文链接

一键关注,点亮星标 ⭐️ 前沿不走丢!
认知神经科学前沿文献分享

基本信息
Title:Merlin: a computed tomography vision–language foundation model and dataset
发表时间:2026-03-04
发表期刊: Nature
影响因子:48.5
获取原文:
- *添加小助手:*PSY-Brain-Frontier即可获取PDF版本
- 点击页面底部“阅读原文”即可跳转论文原网页


研究背景
全球每年进行的计算机断层扫描(CT)约3亿次,其中四分之一为腹部扫描。单次扫描往往包含超过300个切片,放射科医师解释每份检查通常需要20分钟,这种高强度的劳动负荷正导致严重的医师短缺,预计到2036年短缺人数将超过1.9万。
尽管机器学习在影像任务中初露锋芒,但现有的医疗视觉语言模型多局限于2D影像或短报告,难以高效处理复杂的3D体积数据。此外,腹部CT常包含早期疾病的生物标志物,但往往在日常报告中被忽略。针对这一领域痛点,研究者致力于开发一种能直接学习体积影像、电子健康记录(EHR)数据及放射报告的原生3D视觉语言基础模型,以期在减轻诊断负担的同时,挖掘更深层次的疾病预测价值。

实验设计与方法逻辑
本项研究引入了Merlin模型,这是一种原生3D视觉语言基础模型(VLM),旨在通过大规模多模态数据建立腹部CT的通用表征。Merlin采用3D ResNet152作为影像编码器,并通过Clinical Longformer作为文本编码器以处理超长临床序列。
实验范式基于多阶段预训练框架:首先利用EHR中的183万余条结构化诊断代码(ICD代码)通过二元交叉熵损失进行弱监督学习;随后结合600余万个放射报告词元,利用InfoNCE损失进行对比学习,实现影像与文本语义的对齐。核心技术手段还包括放射报告切分技术,即将报告按解剖区域拆分以强化局部特征学习。研究者在涉及5137个内部扫描和44098个外部扫描的大规模数据集上,对Merlin进行了包括零样本分类、表型识别、慢性病预测及语义分割在内的752项任务测试,全面评估其在不同机构、扫描参数及患者人群中的泛化能力。

Fig. 1 | Overview of Merlin training and evaluation. 训练和评估框架图

核心发现
发现一:卓越的零样本临床诊断能力
Merlin在未经特定任务微调的情况下,能根据文本提示直接对30种常见腹部病变进行分类,其在内部验证集上的宏平均F1分数达到0.741,在外部验证集上达到0.647。相比之下,基于2D影像的OpenCLIP和BioMedCLIP模型表现显著逊色。该发现揭示了Merlin在处理复杂病理特征(如胸腔积液、脾肿大等)时具备极强的语义理解力,虽然在阑尾炎等微小病灶上的表现仍具挑战性。

Fig. 2 | Zero-shot classification of findings. Figure 2展示了零样本分类的原理架构及Merlin与多个基准模型的量化对比,证明了原生3D架构在捕获空间体积信息方面的决定性优势。
发现二:高效的表型关联与多疾病风险预测
Merlin在预测692种不同表型时表现稳健,平均AUROC达到0.812,其中在肝脏、肾脏及胃肠道系统疾病中的探测效果尤为突出。此外,模型在5年慢性病风险预测任务中,仅需10%的标注数据即可实现0.708的AUROC,表现优于完全监督的图像专用模型,显示出其在机会性筛查中的巨大潜力。

Fig. 3 | Phenotype classification. Figure 3绘制了前20种高患病率表型组的平均AUROC,揭示了模型性能随训练数据规模增长的缩放规律,验证了大数据驱动下表征学习的深度。
发现三:强大的跨域泛化与解剖学普适性
尽管Merlin仅在腹部CT上训练,但在处理完全不同的胸部CT数据时,其冻结编码器的线性探测AUC表现仍比专门在胸部CT上训练的CT-CLIP和M3FM模型高出12.3%至24.7%。这表明Merlin学习到了具备高度鲁棒性的通用解剖特征,能够有效应对不同医疗机构间的设备差异和报告习惯偏移。

Fig. 5 | External validation on abdominal and chest CT scans. Figure 5的雷达图展示了Merlin在多个外部站点上对30种病征的分类表现,即使在分布移位的环境下,Merlin依然稳居性能曲线最外侧,印证了基础模型在多样化临床场景中的适配力。

省流总结
本研究推出的Merlin模型标志着3D医学影像分析进入了基金模型时代。通过融合1.5万例高质量CT影像、结构化诊断代码与非结构化放射报告,Merlin不仅在零样本诊断、跨模态检索和器官分割等任务中打破了性能天花板,更展现出预测未来疾病风险的巨大潜力。其原生3D设计与多模态数据对齐策略,成功克服了2D模型的局限性,且在外部多站点验证中表现出惊人的泛化性。这项工作证明,利用现有大规模临床数据训练的通用型AI,可以有效缓解放射科医生的工作压力,并为临床决策提供深层次的预判支持。

请打分
这篇刚刚登上 Nature 的研究,是否实至名归?我们邀请您作为“云审稿人”,一同品鉴。精读全文后,欢迎在匿名投票中打分,并在评论区分享您的深度见解。
分享人:天天
审核:PsyBrain 脑心前沿编辑部
💡 关于我们
👋 你好,这里是「PsyBrain 脑心前沿」
🧠 专注追踪全球认知神经科学的最尖端突破
🔍视野直击 Nature, Science, Cell 正刊 及 Nat Neurosci, Nat Hum Behav, Neuron, Sci Adv 等核心子刊与顶级大刊
📄 每日速递「深度解读」与「前沿快讯」,为你打破信息差
科研是一场探索未知的长跑,但你无需独行。欢迎志同道合的你加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。
👇点击卡片进群,欢迎你的到来👇


一键分享,让更多人了解前沿
预览时标签不可点
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务
