论文
我们可以相信LLM的逻辑吗?通过基于图的框架量化不确定性、一致性和稳健性
Can We Trust LLM's Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-Based Framework
摘要
大语言模型 (LLM) 可能容易出现有缺陷和不忠实的推理,诸如自一致性 (SC) 之类的解码策略无法检测到,因为它们仅评估最终答案的一致性,而忽略了中间步骤的逻辑有效性。这就提出了三个基本问题:我们如何可靠地量化 LLM 推理中的不确定性?与朴素的多数投票相比,语义、结构和因果意识能否选择更忠实的推理?以及对抗性条件下推理拓扑的鲁棒性如何?为了解决这些问题,我们引入了 GRAPHEVAL,这是一种基于图的推理框架,它将不确定性量化(UQ)重新构建为整体推理保真度问题。我们提出了一种新颖的 UQ 指标,即图形推理一致性得分(GRCS),它可以量化推理空间的语义结构共识并捕获病理模式崩溃和自信幻觉。我们发现 GRCS 是唯一一个在能力更强和更小的模型中与推理 忠实性 始终呈负相关的指标。此外,我们还引入了图自一致性(GSC),这是一种基于中心点的解码策略,以标称精度换取推理保真度,揭示了较小模型中不忠实的幸运猜测导致 SC 膨胀的程度,同时保持或提高了能力更强的模型的准确性。最后,通过对抗性中心点消融,我们证明 GSC 选择的路径充当“承载路径”,迫使模型远离它会降低推理能力 忠实性,并且在目标情况下导致准确性下降。