论文

一致但错误:证明医疗 LLM 共识何时应弃答

Unanimously Wrong: Certified Abstention from How Medical LLM Consensus Forms

模型推理推理验证与自校正

摘要

临床实践将独立专家的共识视为可靠性证据,多轮共识也成为Agentic医疗问答系统的核心机制。当系统判断是否应信任自身答案时,常再次依据采样答案的一致性。但一致性并非稳健的正确性指标:系统可能每次都给出同一个错误答案,此时基于一致性的信号没有信息。这些信号只读取共识的最终状态,忽略形成过程;通过证据解决分歧而形成的共识,与各次采样从一开始就共享同一误解的共识,最终看起来一样。ProbeGuard是具有风险保证的拒答框架,依据共识形成过程决定是否拒答。过程特征追踪一致性轨迹、少数意见的持续性与检索饱和度。对全票一致的答案,理由语义熵检查其理由是否相互一致,主动探测检索反证并测量共识能否维持。分层Learn-then-Test校准随后将分数转为不依赖分布假设的选择性风险界限。我们使用已发布的多轮Agentic RAG底座,在三个医学问答基准和一个高难度前沿参考集上,与六个拒答基线比较。在MedQA上,全票一致的答案有13.4%错误,基于一致性的信号无法识别。过程信号将正确与错误共识的区分能力从随机水平提升至0.696 AUROC。具有风险保证的规则在全票一致层回答约六成问题,观测选择性风险为9.0%;积累域内校准数据后可回答约九成。

一致但错误:证明医疗 LLM 共识何时应弃答:论文原图
图 1:两种一致的共识与基于快照的弃权 (a) 没有区别,但一种是有知识支持的,另一种是从共同的误解继承的。 ProbeGuard (b) 检查一致投票背后的理由是否相互支持,并使用检索到的反证据对共识进行压力测试,仅在选择性风险可证明受到限制的情况下回答。