论文
推理在哪里中断?通过隐藏状态传输几何进行阶梯级幻觉检测
Where Does Reasoning Break? Step-Level Hallucination Detection via Hidden-State Transport Geometry
摘要
大语言模型 在多步推理过程中产生幻觉,但大多数现有检测器在跟踪级别运行:它们为完整输出分配一个置信度分数,无法定位第一个错误,并且通常需要多个采样完成。相反,我们将幻觉视为单次前向传播过程中产生的隐藏状态轨迹的属性。正确的推理通过稳定的局部相干转换流形进行;第一个错误表现为运输成本远离该歧管的局部偏移。我们使用标签条件教师来操作此视图,该教师构建了特定于轨迹的对比 PCA 透镜,并使用七个几何过渡特征对每个步骤进行评分,以及从教师中提取的可部署 BiLSTM 学生,该学生在没有推理时间标签的情况下对原始隐藏状态进行操作。我们证明对比 PCA 是第一个错误和正确状态之间传输分离目标的最佳投影,并且只要第一个错误在之前的正确转换上产生正传输裕度,单遍第一错误定位就成立。在 ProcessBench、PRM800K、HaluEval 和 TruthfulQA 上,两种模型的性能均优于域内基于熵、基于探测和基于注意力的基线;教师在语言模型和数据集之间稳定地转移,而学生在转移下崩溃,这是我们的 蒸馏 理论预测的差距。这些结果将阶梯级幻觉检测重新定义为轨迹动力学问题,并确定了部署的中心障碍:在分布转移下保持对比传输裕度。