论文

分辨率与简化的结合:用于生成 3D 放射学报告的高效视觉环境

Resolution Meets Reduction: Efficient Visual Context for 3D Radiology Report Generation

模型评测模型能力评测

摘要

视觉语言模型为自动化放射学报告生成提供了一条有希望的途径,但将其应用于完整的 3D CT 体积带来了巨大的计算挑战。现代基础视觉编码器 (VE) 每次扫描可以生成数万个视觉标记,从而使传递到 大语言模型 (LLM) 的视觉序列成为主要计算瓶颈。视觉到语言投影仪可以压缩该序列以减少计算量,但可能会丢弃临床相关细节;相反,有效的压缩可以容纳更高分辨率的输入,同时保持下游词元计数固定。因此,如何在输入视野、空间分辨率和视觉到语言投影之间分配该视觉 词元预算 仍然是一个悬而未决的设计问题。我们在两个大型 CT 报告数据集(CT-RATE 和 Merlin)上系统地评估了四个异构 VE(基于 CNN 和 ViT)、五个压缩率高达 64 倍的词元缩减投影仪以及一个非缩减 MLP 投影仪基线,以及五个指令调整的 LLM (1.7B--4B)。在匹配的 LLM 词元预算 中,解剖学引导的感兴趣区域裁剪是最一致的策略,在 20 个设置中的 19 个设置中,3D ViT Primus 编码器的临床宏观 F1 平均提高了 +3.7 点,基于切片的 2D ViT Curia 编码器平均提高了 +1.1 点。进一步提高输入分辨率很大程度上取决于投影仪:PerceiverResampler 与更高分辨率的 Curia 功能相结合,在两个数据集的分辨率研究中产生最强的配置。我们的最佳配置在测试集上实现了最先进的临床宏 F1,在 CT-RATE 上达到 49.5,在 Merlin 上达到 49.0。代码和模型将在发布后发布。