论文
推理下的校准漂移:思想链预算如何导致 大语言模型 的过度自信
Calibration Drift Under Reasoning: How Chain-of-Thought Budgets Induce Overconfidence in Large Language Models
摘要
大语言模型 (LLM) 表达校准不确定性的能力对于安全部署非常重要。思想链 (CoT) 推理被广泛用于提高准确性和可靠性,但其对校准的影响尚不完全清楚。我们证明这张图是不完整的:在某些设置中,增加推理预算超出特定任务的阈值可能会导致模型变得系统性过度自信,从而对错误答案赋予高置信度。我们将这种现象称为推理下校准漂移(CDUR),并从理论上和实证上对其进行研究。我们定义推理预算 B 并分析预期校准误差 ECE(B) 遵循非单调模式的条件:它首先随着推理纠正错误而减少,然后随着较长的推理产生内部一致但不正确的解释而增加。我们提出了一种基于自回归生成的假设锁定模型来解释这种行为。我们在四个推理预算和三个种子中的 47 个推理陷阱问题上评估 Llama-3.1-8B 和 Llama-3.3-70B(1,368 个 API 调用;574 个有效响应)。 8B 模型显示非单调校准行为,而 70B 模型的结果仅限于基线评估,并且对于预算相关效应没有结论。我们引入了 CABStop,这是一种校准感知停止规则,当置信度偏离辅助精度估计时,该规则会停止推理。这些结果表明,增加推理深度并不总能提高可靠性,应仔细监控。