论文
MedDDC-Eval:多轮医疗咨询代理的诊断解耦评估
MedDDC-Eval: Diagnosis-Decoupled Evaluation of Multi-Turn Medical Consultation Agents
摘要
评估多轮医疗咨询智能体需要判断他们通过互动得出的历史记录所提供的诊断支持。然而,耦合评估让每个策略既引出历史又生成最终诊断,因此诊断分数将引出的历史与策略自己的最终诊断生成器混淆。我们推出了 MedDDC-Eval,这是一个针对来自医疗记录和在线咨询的保留病例的诊断解耦评估测试平台。它将相同的冻结共享诊断读取器应用于每个策略引发的历史记录,保持跨策略固定的终端诊断生成,并在共享诊断读取器下进行比较。它报告诊断支持、信息采集覆盖范围和效率。 LLM 辅助语义匹配以及确定性一对一分配使得诊断轨迹效率 (D/T/E) 分数可审核。在跨八个策略的固定历史审计中,用共享诊断读取器替换每个策略自己的生成器会将诊断 F1 移动 2.2-19.0 个点,并反转记录和对话拆分上的 18% 和 36% 的成对排序。为了检查下游效用,我们使用标准组相对策略优化(GRPO)和针对相同诊断和轨迹维度的单独训练时间奖励。相对于 Qwen3-32B 初始化,经过训练的策略在保留的记录和对话分割上分别获得 9.6 和 4.6 的总分,并且消除任一反馈信号都会降低两者的总分。 MedDDC-Eval 共同支持共享诊断读取器下的比较和基于评估的政策制定,同时在终端诊断生成也是目标能力的一部分时补充端到端评估。