有限校准预算下思维链验证器的拒答与可靠性保证
Certified by Abstention: Distribution-Free Guarantees for Chain-of-Thought Verifiers at Small Calibration Budgets
摘要
预测思想链 (CoT) 跟踪是否正确的信号通过 AUC 进行比较,但部署一个信号需要有一个保证的阈值。我们询问,使用七个开放模型、五个验证器信号和 37,000 个分级迹线,在数十到数百个标记问题的实际校准预算下,免分发选择性保证可以为 CoT 验证者提供什么。中心观察是弃权有效性:以 $P_{\rm fire}$ 概率颁发证书的 $(α,δ)$ 有效程序仅通过 $δ/P_{\rm fire}$ 限制已颁发证书的失败概率,因此很少触发的证书每次使用时都可能有效和错误。在已知风险的模拟中,标准证书在最多 0.3% 的校准抽签中失败,但在其触发的抽签中高达 69% 的失败。 Benjamini-Hochberg 共形选择的认证底线和格子条件解释了为什么证书在这些预算上放弃,并且数据证实了它们:标准证书不返回任何内容或返回大量接受的集合,并且不可读的残差流探针购买 交叉拟合重建的边缘是可读信号覆盖范围的两到三倍,无法从可读特征线性恢复。然后,我们给出一个下限启动的固定序列证书,在没有单调性假设的情况下有效,它覆盖了每个模型信号对上的 Bonferroni 证书,并将非空目标 $0.75π_0$ 的覆盖范围从 0.05 提高到 0.16,尽管下限保持绝对覆盖范围较小。最后,证书无法看到部署后重要的事情:在基准转移下,接受的跟踪之间的误差跟踪新任务的基本误差,并且在针对验证者的 best-of-$n$ 选择下,它超过了目标,而经验失败频率保持在 $δ$ 以下,因为弃权吸收了失败。