论文

PHRBench:评估幻觉上下文之后的推理纠错行为

PHRBench: A Behavioral Evaluation of Post-Hallucination Reasoning in LLMs

模型评测模型推理推理验证与自校正基准与评测资源鲁棒性、公平性与可信度评测

摘要

幻觉信息可以通过多阶段 LLM 系统传播,并成为后续推理上下文的一部分。现有的幻觉后推理(PHR)研究主要描述最终结果和总体推理动态的变化,而对模型如何在响应级别解决幻觉前提的了解还不够。在这项工作中,我们引入了 PHRBench,这是一个跨四个领域和 18 个大型语言模型的行为结构化 PHR 的受控基准。 PHRBench 通过幻觉合规性、幻觉避免和启发式校正来表征每个推理轨迹,而与最终答案的正确性无关,并将有洞察力的轨迹定义为最终达到正确答案的成功校正。在 4820 个受控实例中,我们发现成功恢复仍然相对较少,并且与推理轨迹上更频繁的信念更新相关。我们进一步发现幻觉提示的特性包含成功恢复的大量预测信号,具有 轻量级预测器的 AUROC 达到 0.847。这些发现提供了幻觉后推理的行为观点,描述了LLM如何解决错误的背景以及何时可能成功恢复。

PHRBench:评估幻觉上下文之后的推理纠错行为:论文原图
图 1:幻觉后推理的行为结构概述。 (a) 逃避上游检测的幻觉可以传播到下游推理,使得恢复对于可靠的LLM系统至关重要。 (b) 仅最终正确性无法揭示模型如何处理幻觉上下文。 (c) PHRBench 揭示了脆弱性与修正之间的尺度张力,描述并预测了生成前的成功修正。