论文

多LLM协作MRI报告生成用于脑肿瘤的视觉指令微调

Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology

模型训练合成数据

摘要

大语言模型(LLM)及其向视觉语言模型(VLM)的扩展使图文结合的报告生成等任务更为可行。医学领域的既有VLM通常聚焦2D图像(胸片),向3D影像的扩展因缺乏配对的3D影像—文本数据而困难。为此我们介绍一种为脑肿瘤学创建3D图文数据集的新方法——使用胶质瘤与脑膜瘤病例的3D MRI扫描。我们使用协作系统:多个LLM协同生成并核查报告,确保其准确清晰。利用新的3D MRI—文本数据集,我们进一步构建VLM:把MRI扫描转为token并与文本指令对齐。我们的VLM在报告生成与视觉问答任务上优于其他2D与3D方法。该方法不仅提升报告质量,也有助于脑肿瘤学更好的诊断与治疗。

多LLM协作MRI报告生成用于脑肿瘤的视觉指令微调:论文配图
图 4:带有 3D 图像标记的训练框架图示。使用预训练的 VQ 编码器将 3D 图像压缩为 3D 潜在图像。然后,感知器将潜在图像转换为图像标记,用于通过指令训练 LLM。文本标记代表训练期间提供的指令。 LLM的主干被冻结,只有LoRA进行了微调。