论文

AgentsEval:经多智能体推理的临床忠实医学影像报告评估

AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning

模型评测评测方法与指标

摘要

评估自动生成的医学影像报告的临床正确性与推理保真度仍是一个关键且未决的挑战。现有评估方法常常无法捕捉放射学解读背后的结构化诊断逻辑,导致不可靠的判断与有限的临床相关性。我们提出 AgentsEval,一个模拟放射科医生协作诊断工作流的多智能体流式推理框架。通过把评估过程划分为可解释的步骤——包括标准定义、证据提取、对齐与一致性评分——AgentsEval 提供显式推理轨迹与结构化临床反馈。我们还构建了一个多领域、基于扰动的基准,覆盖五个具有多样成像模态与受控语义变化的医学报告数据集。实验结果表明,AgentsEval 提供临床对齐、语义忠实且可解释的评估,在改述、语义与风格扰动下保持鲁棒。该框架代表迈向医学报告生成系统的透明、临床有临床依据的评估的一步,促进大语言模型在临床实践中的可信整合。

AgentsEval:经多智能体推理的临床忠实医学影像报告评估
图1:评估大模型与视觉-语言模型所生成报告的挑战。传统 NLP 指标无法充分刻画临床正确性,奖励的是表面相似性而非诊断准确性。相比之下,多智能体协作能够实现对医学文本报告的临床层面评估。黄色高亮标示与 ground truth(GT)一致的关键发现,灰色高亮表示事实性出入,蓝色高亮表示同义但正确的表述。