论文

CARE-X:通过辅助监督、奖励调整学习和工具增强测量实现临床有用的放射学 VLM

CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement

模型训练监督微调与指令调优

摘要

临床上有用的胸部 X 射线系统必须超越流畅的报告生成:它应该使用可调决策阈值对结果进行分类,在空间上定位它们,并得出许多诊断所依赖的解剖测量结果。今天的视觉语言模型(VLM)将这些问题视为单独的问题,如果它们能够解决的话,在放射科医生的需要和生成模型提供的之间留下了差距。我们推出了 CARE-X,一种胸部 X 射线 VLM,它通过将辅助判别性监督与奖励对齐生成相结合来缩小这一差距。 CARE-X 通过焦点损失分类和复合损失定位头增强了其生成主干,并与语言建模目标一起进行联合训练。这种辅助监督产生具有可调决策阈值和精确空间定位的判别性诊断预测,同时还提高了报告质量,提供了结构化预测和生成相互促进的证据。在此基础上,解耦剪辑和动态采样策略优化 (DAPO) 利用特定于任务的奖励信号来生成报告、视觉问答 (VQA) 和空间基础,直接优化实践中重要的临床质量指标。其结果是在四个报告生成基准的大多数指标上实现了最先进的性能,ReXVQA 上的 VQA 准确度达到 94.0%(比第二最佳基线高出 6.0 个百分点),并且生成空间解码几乎与专用检测头相当。另外,为了解决依赖于测量的诊断,我们将 Qwen3-VL-4B-Instruct 与本机工具调用功能相结合,以调用确定性测量工具,同时保留对图像的完全视觉访问。这种混合推理在五个依赖于测量的条件下,与仅感知的基线相比,产生了 +43.6 pp 的平均 F1。