论文

解开医疗问答中误导性上下文的机制

Untangling the Mechanisms of Misleading Context in Medical Question Answering

模型评测安全与风险评测

摘要

大语言模型 现在可以以专家级的性能回答医学问题。然而,这些系统所作用的上下文可能会产生误导,而误导性的上下文可能会破坏模型的医学判断。为了理解误导性背景如何破坏这种判断,我们检查了模型对背景的敏感性、背景的披露、破坏推理的机制以及决策的可监控性。在 MedMisBench 的医学推理子集(一个由临床医生审查的包含 8,627 个问题的问答基准)上,我们注入了两种类型的误导性上下文线索:捏造的证据和赤裸裸的断言。我们测试了三种推理模型,其中两种暴露其完整的推理轨迹,一种仅暴露其响应的前沿模型。这三个人都更容易受到这种断言的影响,而不是受到捏造的证据的影响,采用所断言的答案的频率要高出 10 到 27 点。 81% 至 98% 的痕迹中披露了误导性线索,但只有 7% 至 90% 的回复披露了误导性线索,而且该断言的披露频率低于基于证据的线索。在没有披露的情况下从推理痕迹中重新采样表明,这两个线索以不同的方式破坏了推理,证据提前进入并积累,而断言在接近尾声时重定向了结论。当在指导下读取开放模型的跟踪时,LLM 监视器以 5% 的误报捕获了 78% 的损坏决策,而任何响应最多只能捕获 32%。模型最容易受到误导的上下文披露得最少,并且只能从开放推理跟踪中可靠地捕获,而前沿提供商则隐瞒了这一点。