论文
PHRBench:评估幻觉上下文之后的推理纠错行为
PHRBench: A Behavioral Evaluation of Post-Hallucination Reasoning in LLMs
摘要
幻觉信息可以通过多阶段 LLM 系统传播,并成为后续推理上下文的一部分。现有的幻觉后推理(PHR)研究主要描述最终结果和总体推理动态的变化,而对模型如何在响应级别解决幻觉前提的了解还不够。在这项工作中,我们引入了 PHRBench,这是一个跨四个领域和 18 个大型语言模型的行为结构化 PHR 的受控基准。 PHRBench 通过幻觉合规性、幻觉避免和启发式校正来表征每个推理轨迹,而与最终答案的正确性无关,并将有洞察力的轨迹定义为最终达到正确答案的成功校正。在 4820 个受控实例中,我们发现成功恢复仍然相对较少,并且与推理轨迹上更频繁的信念更新相关。我们进一步发现幻觉提示的特性包含成功恢复的大量预测信号,具有 轻量级预测器的 AUROC 达到 0.847。这些发现提供了幻觉后推理的行为观点,描述了LLM如何解决错误的背景以及何时可能成功恢复。
