论文
多轮医疗诊断基准测试:保留、引诱和自我纠正
Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction
摘要
当单轮提供所有临床信息时,大语言模型(LLM)在医学诊断中实现了高精度,但它们在多轮证据积累下的表现如何更接近真实的临床推理仍有待探索。我们引入了 MINT(医疗增量 N-Turn 基准),这是一种高保真、多轮医疗诊断基准,由 1,035 个病例组成,具有临床标记的证据片段、受控的轮次粒度和信息保留分解。通过对 MINT 上的 11 LLM 进行系统评估,我们发现了三种对诊断决策有显着影响的持续行为模式:(1)意图回答,模型在观察到足够的证据之前急于回答,超过 55% 的答案是在前两轮内做出的; (2) 自我纠正,从不正确到正确的答案修改发生率高达从正确到不正确的翻转率的 10.6 倍,揭示了过早承诺排除的自我纠正的潜在能力; (3) 强烈的诱惑、实验室结果等临床显着信息会触发过早的回答,即使模型被明确指示等待。我们将这些发现转化为临床上可操作的指导:将诊断问题推迟到稍后的回合可以减少过早的回答,并将第一点承诺的准确性提高高达 62.6%,同时为以后的回合保留显着的临床证据,可以防止由于过早的承诺而导致高达 23.3% 的灾难性准确性下降。我们的工作为提高 LLM 在多轮医疗诊断中的可靠性提供了受控评估框架和具体建议。