论文

操作一致性:LLM 中组合推理失败的无标签信号

Operadic consistency: a label-free signal for compositional reasoning failures in LLMs

模型评测评测方法与指标

摘要

在没有 真值 标签的情况下在推理时检测 LLM 推理失败激发了广泛的置信基线,包括基于问题内采样和自我评估的自我一致性、语义熵和 P(True)。操作理论(通过迭代替换构建的系统的形式主义)提出了一种补充诊断:模型对组合查询的直接答案应该与其通过组合同一查询的规定分解而产生的答案一致。我们将这个想法实例化为操作一致性(OC),即每个问题的信号。在四个多跳 QA 数据集上的 12 个指令调整的 LLM(4B 到 671B 参数,开放权重和闭源)中,OC 与每个数据集的准确性密切相关(Pearson $r \in [0.86, 0.94]$,所有 $p \leq 0.0004$),并且是我们使用 $r \geq 0.85$ 统一评估的唯一信号所有四个数据集。思想链自我一致性(CoT-SC;Wang et al., 2023)在 HotpotQA 和 DROP 上与 OC 匹配($r = 0.93, 0.87$),但在 MuSiQue 和 StrategyQA 上下降到 $r \approx 0.45$。在每个问题层面,OC 在每个数据集上贡献超出 CoT-SC 和语义熵的信息(OC 系数的集群鲁棒性 $p \leq 10^{-16}$),并且结论对于额外控制构造的分解感知基线 ($p \leq 10^{-13}$) 是鲁棒的。相同的信号在同等成本 $K = 3$ 预算下比经过调整的 CoT-SC 基线产生选择性预测改进(固定覆盖范围的精度)(AUARC 提升 +0.086 至 +0.096,AUROC 提升 +0.092 至 +0.164;95% CI 排除每个小区上的零)。在五个前沿思维模型中,分解是从模型自身的思维链中提取的,相同的等成本比较对所有测试的 16 个(数据集、预算、指标)单元格给出了积极的选择性预测点估计提升,其中 95% CI 排除了 16 个单元格中的 12 个单元格的零。