论文

长形式幻觉检测的健全性检查

Sanity Checks for Long-Form Hallucination Detection

模型评测评测方法与指标

摘要

大语言模型 的幻觉检测方法越来越多地基于思维链推理痕迹进行操作,但仍不清楚它们是评估推理本身还是仅仅利用最终答案的表面关联。我们引入了一种受控不变性方法,该方法通过两个预言测试揭示了这种区别:\textsc{Force},它用 真值 替换每个响应的最终答案,同时保留推理跟踪;以及 \textsc{Remove},它去除答案宣布步骤,同时保持轨迹完整。这揭示了他们的预测能力是否来自答案级别的工件,而不是来自中间推理的结构或有效性。我们进一步表明,一旦控制了这些伪影,有效的检测不一定需要复杂的学习表示:TRACT,一个基于词汇轨迹特征(对冲趋势、步长动态和交叉响应词汇收敛)构建的轻量级评分器,实现了强大的鲁棒性,同时在未受干扰的轨迹上保持与现有基线的竞争力或优于现有基线。这些发现表明,目前推理感知幻觉检测的主要挑战不是轨迹中缺乏信号,而是未能将其与端点线索隔离开来。