论文

这种治疗有效,对吗?评估医疗 QA 中患者问题框架的 LLM 敏感性

This Treatment Works, Right? Evaluating LLM Sensitivity to Patient Question Framing in Medical QA

模型评测鲁棒性、公平性与可信度评测

摘要

越来越多的患者因复杂且难以清晰表达的医疗问题而转向 大语言模型 (LLM)。然而,LLM 对提示措辞敏感,并且可能受到问题措辞方式的影响。理想情况下,无论措辞如何,LLM 都应该做出一致的反应,特别是当基于相同的基础证据时。我们通过在医学问答(QA)的受控检索增强生成(RAG)设置中进行系统评估来调查这一点,其中使用专家选择的文档而不是自动检索。我们检查患者查询变化的两个维度:问题框架(积极与消极)和语言风格(技术与简单语言)。我们构建了一个基于临床试验摘要的 6,614 个查询对的数据集,并评估了 8 个 LLM 的响应一致性。我们的研究结果表明,积极和消极框架的配对比相同框架的配对更容易产生矛盾的结论。这种框架效应在多轮对话中进一步放大,持续的说服会增加不一致的情况。我们发现框架和语言风格之间没有显着的相互作用。我们的结果表明,即使基于相同的证据,医学 QA 中的 LLM 响应也可以仅通过查询短语受到系统性影响,这凸显了短语稳健性作为高风险环境中基于 RAG 的系统的评估标准的重要性。