论文

超越标量评分:探索基于 LLM 的放射学报告中临床意义评估指标

Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports

模型评测评测方法与指标

摘要

对生成的放射学报告进行可靠评估需要严格的临床准确性,因为遗漏的关键发现或错误描述的放射学观察结果可能会直接影响患者护理。现有的指标通过将报告质量降低到医学上没有根据的标量来掩盖这一要求。尽管大语言模型(LLM)拥有丰富的医学知识,但他们同样难以在临床重大错误和无害变异之间划定可靠的界限。我们使用 ReEvalMed 基准作为测试平台来研究这一边界,并通过检测真实的临床错误(“歧视”)和容忍微不足道的变化(“稳健性”)来评估指标水平的临床意义。在一次和两次设置下的 8 个 LLM 评估器中,我们发现了一种普遍存在的歧视偏差:模型有效地检测到错误,但也会过度惩罚无害的改写。为了缓解这个问题,我们合成了 4k 报告对并在 Qwen3-8B 和 MedGemma-4B 上训练轻量级可解释指标。我们训练有素的指标锐化了临床意义边界,超越了 32B 规模的医学 LLM,并与专有模型保持竞争力。至关重要的是,成本更高的两次通过设置无法持续提高整体性能,并且主要以歧视性换取鲁棒性。这些发现表明,单遍训练指标是成本敏感型部署的实际选择,而两遍推理则保留用于 D-R 平衡至关重要的设置。我们将发布数据集和指标。