论文
MedRoundsQA:一种基于角色与难度感知的多轮医疗咨询评估方法
MedRoundsQA: A Persona and Difficulty Aware Evaluation for Multi-Turn Medical Consultations
摘要
医疗基准测试主要依赖单轮、多选的临床案例,难以反映真实诊疗场景。实际诊疗中,医生通过互动获取证据,患者沟通方式差异显著。我们提出了MedRoundsQA,一个基于1,387个专业考试案例(涵盖17个专科)的多轮诊断基准测试。每个案例被转换为包含24个字段的结构化临床记录,并以受控的医生-患者双智能体对话形式实现,患者角色各异,但底层临床内容保持不变。我们进一步基于模型不确定性对案例按难度分类,实现易到难的分析。对十五个大语言模型医生智能体的评估显示:(i)从标准化单轮诊断转向多轮诊疗,准确率下降约13-39分;(ii)增加对话轮数能提升问题相关性,但诊断准确率的提升收益递减,通常在6-12轮后趋于稳定;(iii)不同患者角色(从低到高教育水平)可使诊断准确率变化约7-8分,凸显单轮基准测试所遗漏的公平性风险。
