论文

通过置信度动态优化推理时间

Inference Time Optimization with Confidence Dynamics

模型推理推理验证与自校正

摘要

重复采样等推理时间优化技术显着提高了大语言模型(LLM)的推理能力。然而,在这些优化策略中,模型不确定性的关键作用在很大程度上仍未得到充分探索。在本文中,我们研究了推理轨迹上的置信度动态,并首次揭示了一个令人惊讶且独特的模式:正确答案轨迹往往会随着时间的推移表现出置信度的提高(正置信度增益),而错误的轨迹则显示出随着推理的进行而减弱或下降的置信度。基于这一观察,我们提出了基于置信动态增益(CDG)的投票,其中结合了响应的置信轨迹如何沿着推理链演变。在 AIME24/25、HMMT25 和 BRUMO25 基准测试上跨四种开源架构(DeepSeek-R1、gpt-oss、Gemma-3、Qwen-QwQ)进行的实验表明,CDG 的性能较基准有显着提升。这些结果表明,我们的方法为改进 LLM 推理中的答案选择提供了强大的判别信号。我们还为这种现象提供了理论见解。代码将在 https://github.com/Accenture/CDG.git 发布。