论文

超越域内检测:面向跨域幻觉检测的SpikeScore

Beyond In-Domain Detection: SpikeScore for Cross-Domain Hallucination Detection

模型评测评测方法与指标

摘要

幻觉检测对在真实应用中部署大语言模型(LLM)至关重要。现有幻觉检测方法在训练与测试数据来自同一领域时表现强劲,但跨域泛化能力差。本文研究一个重要却被忽视的问题,称为可泛化幻觉检测(GHD),旨在用单一领域数据训练幻觉检测器,同时确保在多样相关领域上的稳健性能。在研究GHD时,我们模拟LLM初始回答之后的多轮对话,并观察到一个有趣现象:跨不同领域,由幻觉发起的多轮对话普遍表现出比事实性对话更大的不确定性波动。基于该现象,我们提出新分数SpikeScore,量化多轮对话中的突变波动。通过理论分析与实证验证,我们证明SpikeScore在幻觉与非幻觉回答之间实现强跨域可分性。跨多个LLM和基准的实验表明,基于SpikeScore的检测方法在跨域泛化上优于代表性基线,并超越先进的面向泛化的方法,验证了其在跨域幻觉检测中的有效性。

超越域内检测:面向跨域幻觉检测的SpikeScore
图1:多轮对话中自我矛盾的案例研究。SAPLMA 得分(基于 Llama-3.1-8B-Instruct,在 Math 上训练、在 CoQA 上测试——一个代表性的跨域设置)呈现出截然不同的轨迹:由幻觉开启的对话(左)在不确定性信号上出现明显尖峰,与事实性对话相对平稳的波动(右)形成对比。检查尖峰位置的对话内容可以发现,幻觉响应在相互矛盾的观点之间摇摆并频繁反转立场(蓝色:提示;红色:错误;绿色:事实性响应),而事实性对话保持一致,仅有少量自我修正。