论文

通过逐步置信归因诊断黑盒 LLM 中的多步推理失败

Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

模型推理推理验证与自校正

摘要

大语言模型 通过生成分步解决方案,在具有客观答案的推理任务上取得了出色的性能,但诊断多步推理跟踪可能失败的位置仍然很困难。置信度估计提供了诊断信号,但现有方法仅限于最终答案或需要内部模型访问。在本文中,我们介绍了逐步置信归因(SCA),这是一个闭源 LLM 的框架,仅根据生成的推理轨迹分配步进级别的置信度。 SCA 应用信息瓶颈原则:在正确的解决方案中与共识结构保持一致的步骤会获得高置信度,而偏差则被标记为潜在错误。我们提出了两种互补的方法:(1) NIBS,一种在没有图结构的情况下测量一致性的非参数 IB 方法;(2) GIBS,一种基于图的 IB 模型,通过可微掩码学习子图以捕获逻辑可变性。数学推理和多跳问答的大量实验表明,SCA 可靠地识别与推理错误密切相关的低置信度步骤。此外,使用阶梯级置信度来指导自我修正,与答案级反馈相比,修正成功率最高可提高 13.5%。