论文

信任但验证:通过事后对抗性审计和多代理反馈循环减轻医学幻觉

Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 越来越多地部署在医疗保健环境中,但在涉及临床决策时,它们产生幻觉的倾向会带来风险。本研究检查 LLM 在回答临床问题时是否推荐最近禁用或撤回的药物,并测试基于代理的方法来减少此类错误。我们使用单个 LLM 主干开发了一个五代理“信任但验证”系统。为了衡量监管知识的过时程度,我们创建了一个包含 103 个临床 MCQ 的对抗性数据集,其中历史上正确的答案现在涉及禁用物质。该量表确保了不同治疗类别的统计显着性。我们在普通和代理条件下评估了三个开放访问模型系列(GPT-OSS、Llama-3、Falcon-3)。通过逐点评分、标签准确性、幻觉错误率 (HER) 和组件保真度 (CF) 评分来衡量性能。我们还在专有模型中观察了临床安全性回归。在默认配置下,所有模型都表现出较高的幻觉率,始终选择与训练数据模式相匹配的禁用药物。我们提出的代理架构将模型中的 HER 减少了约 53%。逐点评分从 -0.25(不安全推荐)转变为 0.0(适当拒绝)。即使模型的参数知识有利于禁用物质,安全审计也会拦截危险的输出。所提出的多代理框架提供了一种与模型无关的方法来强制执行法规遵从性,该方法将患者安全置于流畅的文本生成之上。我们的工作展示了在安全关键的医疗保健环境中部署自主人工智能系统的实用方法。它展示了如何将实时监管数据集成到 LLM 管道中以支持临床决策。