论文
多LLM协作MRI报告生成用于脑肿瘤的视觉指令微调
Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology
摘要
大语言模型(LLM)及其向视觉语言模型(VLM)的扩展使图文结合的报告生成等任务更为可行。医学领域的既有VLM通常聚焦2D图像(胸片),向3D影像的扩展因缺乏配对的3D影像—文本数据而困难。为此我们介绍一种为脑肿瘤学创建3D图文数据集的新方法——使用胶质瘤与脑膜瘤病例的3D MRI扫描。我们使用协作系统:多个LLM协同生成并核查报告,确保其准确清晰。利用新的3D MRI—文本数据集,我们进一步构建VLM:把MRI扫描转为token并与文本指令对齐。我们的VLM在报告生成与视觉问答任务上优于其他2D与3D方法。该方法不仅提升报告质量,也有助于脑肿瘤学更好的诊断与治疗。
