论文

大型推理模型中黑盒不确定性量化的越狱

Jailbreaks for Black-Box Uncertainty Quantification in Large Reasoning Models

模型评测评测方法与指标

摘要

虽然大型推理模型 (LRM) 擅长复杂推理,但通过强化学习进行调整往往会导致系统性过度自信。在生产环境中,logits 可能不可用,强大的黑盒不确定性量化 (UQ) 对于可信性和安全性至关重要。专注于 LRM 的问答,我们表明现有的黑盒方法,例如基于释义的自我一致性和置信度语言表达,与简单的重复采样相比几乎没有任何改进,这表明对齐抑制了有用的输出变异性。我们引入了即时级松弛算子,通过近似使用更强的 KL 正则化参数获得的最优策略的效果来扩大模型的有效输出分布,从而更接近参考模型。从理论上讲,我们证明松弛可以改善校准。我们提出了不确定性越狱(J4U),这是昆士兰大学的一种越狱衍生技术,可以根据经验重现我们的松弛理论预测的行为特征。在 3 个数据集和 4 个 LRM(包括闭源生产模型)中,J4U 对重复采样的改进实现了统计显着性,其 LRM 数据集指标设置比我们评估的最强黑盒 UQ 最先进基线高出 6 倍,平均 ECE 降低幅度高达 5 倍。这些结果为 UQ 的黑盒 LRM 部署提供了实用工具。