论文
VERT:用于放射报告评估的可靠LLM裁判
VERT: Reliable LLM Judges for Radiology Report Evaluation
摘要
当前关于放射报告评估的文献主要集中于为胸部X光设计基于LLM的指标以及对小模型进行微调。然而,这些方法应用于其他模态与解剖部位的报告时是否稳健,仍不清楚。哪些模型与提示词配置最适合充当放射学评估的LLM裁判?我们对专家评分与基于LLM的评分进行了深入的相关性分析。我们在两个覆盖多种模态与解剖部位、由专家标注的数据集RadEval和RaTE-Eval上,使用不同规模的开源与闭源模型(含推理型与非推理型),将三个现有LLM-as-a-judge指标(RadFact、GREEN和FineRadScore)与我们提出的基于LLM的指标VERT进行对比。我们进一步在RaTE-Eval上评估了少样本方法、集成方法与参数高效微调。为更好地理解指标行为,我们开展了系统性的错误检测与归类研究,评估这些指标与专家判断的一致程度,并识别一致性较低与较高的领域。结果显示,与GREEN相比,VERT将与放射科医生判断的相关性提升了最高11.7%。此外,仅用1,300个训练样本微调Qwen3 30B即可获得最高25%的提升。微调后的模型还将推理时间最多缩短37.2倍。这些发现凸显了基于LLM的裁判的有效性,并表明通过轻量化适配即可实现可靠评估。
