目的融合影像报告的大语言模型(LLM)推理信息与呼气挥发性有机物(VOCs)特征,构建并验证一种用于肺癌诊断的多模态智能诊断模型。方法采用前瞻性诊断试验设计,纳入2019年2月至2019年9月来自天津医科大学肿瘤医院和2020年10月至2021年7月来自天津医科大学总医院经病理确诊的752例肺结节患者(良性141例,肺癌611例),收集其呼气样本、影像报告及相关临床资料,并将752例样本按7∶3分层随机分为训练集(526例)与验证集(226例)。采用质子转移反应飞行时间质谱仪采集与检测呼气样本,筛选出22种内源性VOCs特征用于建模。同时,利用多代理系统对非结构化影像报告进行关键信息抽取与结构化重组。将结构化报告文本输入经提示词设计与5示例优化的Qwen2.5VL-7B多模态LLM中,生成诊断推理结果后由双向编码器表示模型进行分类判别。最终将LLM推理结果与22种呼气VOCs特征融合,基于XGBoost算法构建用于肺癌诊断的影像报告与呼气分析(RB)多模态模型。以病理诊断为金标准,采用准确率、灵敏度、特异性及受试者工作特征曲线下面积(AUC)评估模型诊断性能,并与单模态影像报告模型、单模态呼气分析模型及放射科医师诊断进行对比。连续变量组间比较采用Welch
t检验,分类变量组间比较采用
χ2检验,所有检验均为双侧检验。
结果在验证集上,RB多模态模型的诊断性能最佳,准确率、灵敏度、特异性分别达87.2%、90.8%、73.8%,均优于单模态影像报告模型(73.3%、76.5%、61.9%)和单模态呼气分析模型(67.2%、66.0%、71.4%);RB多模态模型的诊断的准确率、灵敏度、特异性同样优于放射科医师诊断(82.6%、89.3%、53.5%)。此外,RB多模态模型的AUC为0.86,高于单模态影像报告模型(0.69)、单模态呼气分析模型(0.71)及放射科医师诊断(0.79)。结论融合影像报告LLM推理信息与呼气VOCs特征构建了RB多模态模型,该模型在本研究队列中表现出优于单模态影像报告模型和单模态呼气分析模型的肺癌诊断性能。