近日,上海科技大学生物医学工程学院沈定刚团队联合上海联影智能、北京联影智能等机构,在Nature 旗下期刊 《npj 数字医学》(npj Digital Medicine) 上在线发表了题为 “Learning Like a Radiologist: A Medical Vision-Language Model for Radiological Image Analysis via Curriculum Learning” 的研究论文。联合团队开发了一种面向放射影像分析的医学视觉语言模型 RadiSim-CL,旨在提升模型在 MR、CT、DR 等多模态影像及不同层级诊断任务中的泛化能力,为医学视觉语言模型走向复杂放射诊断推理提供了新的路径。

图1官方页面文章图
放射影像是疾病诊断和治疗评估的重要依据,但快速增长的影像数据给放射科医生带来了持续增加的阅片压力。现有医学视觉语言模型虽然在医学图像理解中展现出潜力,但在训练数据质量、适用范围和评价方式上与真实临床需求仍存在差距。该研究创新性地从放射科医生的学习和阅片逻辑出发,将数据构建、模型训练和模型验证设计为相互衔接的整体框架。

图2 RadiSim-CL 研究总体框架。(A) RadiSim 数据集构建与分布;(B) 三阶段课程学习训练策略;(C) 五阶段由粗到细的临床化评估体系。
在数据层面(图2A),研究构建了大规模放射影像-文本数据集 RadiSim。该数据集初始汇集了约6118万组影像-文本对,经过系统清洗、筛选和语义增强后,最终形成1200万组高质量放射影像-文本对,并按照知识层级组织为基础医学图文数据、解剖结构相关数据和诊断报告相关数据。
在模型训练层面(图2B),RadiSim-CL 采用“基础知识理解—解剖知识获取—高级诊断推理”的三阶段课程学习策略。模型首先学习医学图像与文本之间的基础对应关系,随后强化对人体解剖结构及空间关系的理解,最终进一步学习异常检测、疾病诊断、疾病分型和分级等高阶任务。
在模型验证层面(图2C),研究建立了五阶段由粗到细的评估体系,依次评估影像模态识别、解剖结构识别、解剖结构定位、异常与疾病诊断、疾病分型与分级能力,覆盖 MR、CT、DR 三类影像模态和24个零样本子任务。实验结果显示,RadiSim-CL 在基础识别任务中表现稳定。在更复杂的疾病相关任务中,RadiSim-CL 同样表现突出,并在脑肿瘤分型、脑膜瘤分级、肺腺癌亚型分类等细粒度任务中取得较好结果,脑肿瘤分型准确率达到0.835。
消融实验(图3)进一步表明,相比直接混合训练,按照临床认知路径组织数据并进行课程式训练,能够帮助模型逐步获得更稳定的医学影像理解能力。在肺炎诊断任务中,课程训练使 AUC 从0.315提升至0.852,显示训练顺序和数据组织方式对医学视觉语言模型的能力形成具有重要影响。

图3 消融研究证明了课程学习策略的影响。拟议的基于课程的培训(RadiSim-CL)和统一培训基线(RadiSim-uniform)之间的性能比较,以及中间模型(RadiSim-CL1和RadiSim-CL2)
该工作为医学视觉语言模型从通用图文对齐走向临床化诊断推理提供了新的技术路径,也为未来放射影像辅助诊断、智能筛查和临床决策支持系统的构建提供了方法基础。
上海科技大学生物医学工程学院博士研究生谭敏慧、北京联影智能吴青霞为论文的共同第一作者。上海科技大学沈定刚教授(同时任联影智能联席CEO)和上海联影智能曹晓欢(同时任上海科技大学生物医学工程学院特聘研究员)为共同通讯作者。上海科技大学为第一完成单位。上海联影智能、北京联影智能等单位参与合作研究。
