论文
当答案偏离问题时:通过问答正交分解进行幻觉检测
When Answers Stray from Questions: Hallucination Detection via Question-Answer Orthogonal Decomposition
摘要
大语言模型 (LLM) 中的幻觉检测需要平衡分布偏移的准确性、效率和鲁棒性。黑盒一致性方法有效,但需要重复推理;单通道白盒探测非常高效,但孤立地处理答案表示,通常在域转移下急剧退化。我们提出了 QAOD(问题-答案正交分解),这是一种单通道框架,可以将问题对齐方向从答案表示中投影出来,以获得抑制域条件变化的问题正交分量。为了识别信息信号,QAOD 进一步通过多样性惩罚 Fisher 评分来选择层,并通过 Fisher 重要性来区分神经元。为了解决域内检测和跨域泛化问题,我们设计了两种互补的探测策略:将正交分量与问题上下文配对产生一个联合探测,最大限度地提高域内可辨别性,而单独使用正交分量可以保留与域无关的事实信号以实现稳健的传输。 QAOD 的联合探针在所有评估的模型-数据集对中实现了最佳的域内 AUROC,而纯正交探针提供了最强的 OOD 传输,在 BioASQ 上以低于 25% 的生成成本超过最佳白盒基线高达 21%。