论文
Reasoning Denoiser:面向大型推理模型幻觉检测的推理轨迹去噪
Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models
摘要
大型推理模型(LRM)在产生最终答案之前会生成长推理轨迹。虽然这些轨迹可能包含对幻觉检测有用的信号,但利用它们并非易事,因为长轨迹往往包含噪声步骤,会掩盖与真实性评估相关的线索。本文识别出两种常见的推理噪声形式,即无关步骤与重复步骤,并证明二者都会显著降低幻觉检测性能。现有的基于置信度的分数和朴素的基于嵌入的过滤无法可靠地区分噪声步骤与有信息量的步骤。为应对这一挑战,我们提出 REDE,一个用于推理轨迹去噪以支持幻觉检测的新型学习框架。具体而言,REDE 利用最终答案注意力作为自动监督信号来塑造步骤级表示空间,得到精化后的嵌入,使噪声步骤能够被可靠地识别并过滤。通过在去除噪声步骤后的过滤推理轨迹上运行,REDE 可以便捷地插入各类幻觉检测器。在多个推理基准上的大量实验表明,REDE 持续优于有竞争力的基线,改进了检测性能。
