论文
评估 大语言模型 多轮医学对话中的误解
Evaluating Large Language Models on Misconceptions in Multi-Turn Medical Conversations
摘要
寻求医疗信息的患者经常会提出包含不正确假设或误解的问题。在这种情况下,安全的医疗沟通不仅需要回答问题,还需要识别和纠正潜在的错误信念。这些交互自然地在多个回合中展开,这种模式现在反映在与 LLM 的交互中。然而,当前的评估框架无法捕捉这些环境中的模型行为,在对话过程中,误解可能会出现、持续或演变。随着时间的推移,LLM 是否能够可靠地纠正此类误解仍然很大程度上尚未得到检验。为了研究这一点,我们引入了 ThReadMed-QA,这是一个多回合医疗对话数据集,包含 2,437 个患者与医生对话线程,其中包含 8,204 个问答对,源自 AskDocs 上的真实患者交互。该数据集可以系统地评估模型是否可以在多回合环境下检测和纠正误解。我们使用基于标题的 LLM 法官框架来评估五个 LLM,该框架根据他们识别和纠正误解的能力对回答进行评分。我们的实验揭示了一个一致的模式:即使是能够解决单次交互中的误解的前沿模型,在后续回合中也会大幅退化。 GPT-5 和 Claude-Haiku 在最初的问题上纠正了大约 85% 的错误预设,但在两次后续问题中下降到大约 50%。用医生响应替换先前模型输出的预言机分析表明,大部分性能下降是由错误传播引起的,而即使在正确的上下文下,性能仍然不完美。即使模型一开始倾向于纠正误解,其性能在以后的回合中也会大幅下降,导致面向患者的环境中指导不一致且可能不安全,并强调需要捕获多回合行为的评估框架。