论文

构建与评估医疗智能体的临床推理轨迹

Constructing and Evaluating Clinical Reasoning Trajectories for Medical Agent

模型评测评测方法与指标

摘要

医学人工智能体的评估仍然主要以答案为中心,仅评估最终输出的正确性,而忽略中间推理的质量。然而,在临床环境中,通过伪造的证据或不连贯的逻辑得出的正确答案与错误的答案一样危险。我们提出了 MedTraj,一个将推理轨迹视为构建、评估和优化的关键对象的框架。该管道从医学推理源生成结构化的多步骤推理链。然后将每个轨迹解析为临床观察、证据、编号推理步骤和最终结论,并在五个质量维度上进行评分:连贯性、证据支持、幻觉、完整性和可追溯性。受控错误注入将目标错误引入到原本正确的轨迹中,以在特定推理失败和可测量的质量下降之间建立因果关系。在此基础上,基于边际贡献的步骤级过滤可以识别哪些单独的推理步骤推动或破坏轨迹质量。最后,质量加权上下文学习在推理时将轨迹评估反馈回模型,使其能够从强推理演示和弱推理演示中学习。 CareQA、PubMedQA 和 CECMed 的实验表明,轨迹上下文持续提高推理连贯性,比零样本基线提高了 +0.029 到 +0.041。在 CECMed 上,质量加权上下文的正确性几乎比零样本基线提高了一倍,同时将幻觉率降低了 87%。边际贡献分析进一步表明,少数推理步骤携带了大部分质量信号,并且将链延伸到四个步骤以上会产生收益递减。

构建与评估医疗智能体的临床推理轨迹:论文配图
图 5:所有方法和数据集的正确性、一致性、证据评分和幻觉的分布。 (红色菱形 = 平均值)