论文
CoRefine:面向自适应测试时计算的信度引导自我精炼
CoRefine: Confidence-Guided Self-Refinement for Adaptive Test-Time Compute
摘要
大语言模型(LLM)常依靠并行解码的测试时扩展(例如512个样本)来提升推理准确率,但这会带来大量计算。我们提出CoRefine,一种信度引导的自我精炼方法:在冻结LLM之上加装一个轻量的211k参数Conv1D控制器,用一小部分token即可达到有竞争力的准确率。该控制器读取完整轨迹的置信度,决定停止、重新检查还是尝试不同方法,实现有针对性的自我纠正,平均每个问题2.7次精炼步骤,相对512样本基线约减少190倍token。在多样的推理基准与三个开源模型上,该控制器在自信停止时达到92.6%的精确率,表明置信度动态能在没有真值验证的情况下可靠地指示正确性。我们将其扩展为CoRefine-Tree,一种顺序-并行混合变体,可自适应平衡探索与利用,便于服务端集成并与验证器兼容。通过把置信度当作控制信号而非正确性保证,CoRefine为可扩展推理以及验证器不完备的agentic场景提供了一个模块化原语。
