论文

生成报告还是重复模板?测量和缓解 3D CT 报告生成中的模板崩溃

Generating Reports or Repeating Templates? Measuring and Mitigating Template Collapse in 3D CT Report Generation

上下文与知识检索增强

摘要

现代 3D 医学视觉语言模型 (VLM) 可以生成流畅的放射学风格的文本,同时表现出极低的病理检测和输出多样性,崩溃为通用模板,无法报告罕见但关键的发现。我们将这种故障模式称为“模板崩溃”。这种失败源于 3D 医学成像的独特限制,例如有限的数据、严重的标签不平衡以及来自体积编码器的微弱信号。在这些限制下,文本生成目标鼓励快捷学习和流畅但基础薄弱的报告。我们通过临床保真度、输出多样性、正常模板偏差和罕见的生存率来系统地诊断模板崩溃。为了缓解这个问题,我们提出了 CLarGen,这是一个解耦框架,它将说什么(临床检测)与如何说(语言合成)分开。 CLarGen 使用 (i) 潜在查询 Transformer 进行多标签病理检测,(ii) 临床匹配范例的病理引导检索,以及 (iii) 医学语言模型根据检测结果和检索上下文合成最终报告。在最先进的 3D CT 报告生成基线中,CLarGen 减轻了模板崩溃并显着提高了临床准确性(宏观 F1 0.487 与 0.189;CRG 0.472 与 0.368),同时保持流畅的报告。我们的结果表明,明确的、可测量的临床基础对于抗模板崩溃的 3D CT 报告生成至关重要。代码可在 https://github.com/ai-med/CLarGen 获取。