论文
AgentsEval:经多智能体推理的临床忠实医学影像报告评估
AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning
摘要
评估自动生成的医学影像报告的临床正确性与推理保真度仍是一个关键且未决的挑战。现有评估方法常常无法捕捉放射学解读背后的结构化诊断逻辑,导致不可靠的判断与有限的临床相关性。我们提出 AgentsEval,一个模拟放射科医生协作诊断工作流的多智能体流式推理框架。通过把评估过程划分为可解释的步骤——包括标准定义、证据提取、对齐与一致性评分——AgentsEval 提供显式推理轨迹与结构化临床反馈。我们还构建了一个多领域、基于扰动的基准,覆盖五个具有多样成像模态与受控语义变化的医学报告数据集。实验结果表明,AgentsEval 提供临床对齐、语义忠实且可解释的评估,在改述、语义与风格扰动下保持鲁棒。该框架代表迈向医学报告生成系统的透明、临床有临床依据的评估的一步,促进大语言模型在临床实践中的可信整合。
