经推理轨迹度量黑盒置信度:几何、覆盖与言语化
Measuring Black-Box Confidence via Reasoning Trajectories: Geometry, Coverage, and Verbalization
摘要
可靠的置信度估计可通过纯文本 API 安全部署思想链 (CoT) 推理。然而,占主导地位的黑盒基线,即 K 个样本的自洽性,是线性昂贵的,并且忽略了迹线的几何形状。我们提出了一种黑盒轨迹置信度评分:我们将 CoT 作为滑动窗口轨迹嵌入,并使用单参数 softmax 来测量其与外部答案锚点的收敛性。该方法不需要logits、隐藏状态或监督校准器。在 MedQA-USMLE、GPQA Diamond 和 MMLU-Pro(使用 Gemini 3.1 Pro 和 Claude Sonnet 4.6)的六种(基准、推理)设置中,将该分数与 K=4 处的覆盖范围和言语置信度通道融合,在 6/6 设置中,在 K=8 处产生相对于自我一致性的帕累托改进(中位 AUC 0.78 与 0.71, deltaAUC=+0.075)。固定选择控制 (+0.060) 和 E5 交叉嵌入器复制排除了答案切换和单一供应商工件。几何在基准测试和推理器的倒数第二个窗口中达到峰值,并在 GPQA Diamond 的终端窗口中反转。三种无支架机制将黑盒置信度分为法官介导的覆盖先验 (C)、迹内几何 (G) 和条件语言化通道 (V)。在 18 个基准 x 推理器 x 提议者设置中,C 和 G 在 18/18 和 16/18 中提供独立信号,而 V 在 6/18 中贡献残余信号。将判断从 GPT-5-mini 替换为 Claude Sonnet 4.6 会使仅 G 的 AUC 保持不变 (|delta|<=0.013),并将仅 C 的 AUC 最多移动 +/-0.02 (kappa=0.82)。 Fusion 在 17/18 设置中击败了最好的单通道(中位 AUC 0.78,最大值 0.92)。