论文
经结构不确定性量化LLM逻辑推理一致性
Quantifying Consistency in LLM Logical Reasoning via Structural Uncertainty
摘要
大语言模型可经不稳定、矛盾或难以一致排序的推理路径得出相同答案——该失败模式在多步演绎推理中尤为普遍。既有方法主要通过输出离散度评估可靠性——度量抽样答案差异多大——但这丢弃了互补信号:模型能否一致地为竞争推理候选排序。我们提出结构不确定性——一致性感知框架——导出自抽样推理解上自我偏好诱导排序的稳定性。给定查询——我们生成多个候选解——并让模型对其自身输出做成对偏好判断。我们经带PageRank的Bradley-Terry建模把自我偏好聚合为排序分布——并把信号分解为两个基于熵的成分:跨试次排序不稳定与试次内候选歧义。跨五个LLM与八个基准——结构信号提供与答案离散度互补的信息:在逻辑与数学推理任务上——组合改进不可靠实例的识别;而在事实检索上结构信号坍缩向均匀——诊断出推理级一致性评估无信息量的机制边界。两个成分与准确率的关系不同:试次内歧义与正确性正相关——与多条合理解路径保持竞争的设定一致;跨试次不稳定负相关——标记不可靠推理。结构不确定性最好被理解为机制敏感的逻辑推理一致性评估器——而非通用置信估计器。
