论文

CoRefine:面向自适应测试时计算的信度引导自我精炼

CoRefine: Confidence-Guided Self-Refinement for Adaptive Test-Time Compute

模型推理测试时计算扩展

摘要

大语言模型(LLM)常依靠并行解码的测试时扩展(例如512个样本)来提升推理准确率,但这会带来大量计算。我们提出CoRefine,一种信度引导的自我精炼方法:在冻结LLM之上加装一个轻量的211k参数Conv1D控制器,用一小部分token即可达到有竞争力的准确率。该控制器读取完整轨迹的置信度,决定停止、重新检查还是尝试不同方法,实现有针对性的自我纠正,平均每个问题2.7次精炼步骤,相对512样本基线约减少190倍token。在多样的推理基准与三个开源模型上,该控制器在自信停止时达到92.6%的精确率,表明置信度动态能在没有真值验证的情况下可靠地指示正确性。我们将其扩展为CoRefine-Tree,一种顺序-并行混合变体,可自适应平衡探索与利用,便于服务端集成并与验证器兼容。通过把置信度当作控制信号而非正确性保证,CoRefine为可扩展推理以及验证器不完备的agentic场景提供了一个模块化原语。

CoRefine:面向自适应测试时计算的信度引导自我精炼
图1:上:四个推理基准AIME24、AIME25、BRUMO25和HMMT25上的token效率与准确率。CoRefine以约190×更少的token,取得与512样本或20样本多数投票相当或更优的准确率。实际运行时间与准确率的对比表明,token节省可转化为实际时延降低,CoRefine相比并行基线最多节省63%。下:Confidence-Guided Self-Refine概览。控制器读取LLM解码推理链的全程置信度特征,并据此决定:HALT(接受当前答案)、RETHINK(复核推理)或ALTERNATIVE(探索新方法)。