论文

SuCo:充足性引导的连续自适应推理

SuCo: Sufficiency-guided Continuous Adaptive Reasoning

模型推理测试时计算扩展

摘要

尽管在复杂任务上表现出色,但大型推理模型 (LRM) 经常生成过长的思想链 (CoT),即使对于简单的查询也会增加计算成本。现有的缓解这种低效率的努力通常依赖于离散推理模式或固定预算层级,缺乏推理何时足够的原则标准。在这项工作中,我们引入了最小足够 CoT (MSC),定义为足以产生正确答案的 CoT 轨迹的最短前缀。我们的经验表明,MSC 不仅减少了推理标记,还提高了不同难度级别的准确性。在 MSC 的基础上,我们提出了充足性引导的连续自适应推理(SuCo),这是一种沿连续谱进行自主推理控制的两阶段训练框架。在第 1 阶段,MSC-Aligned 微调 (MFT) 使用问题自适应充分性阈值构建 MSC 数据,这些阈值会随着问题难度自然缩放,然后微调模型以内化简洁而充分的推理模式。在第二阶段,充足性感知策略优化 (SAPO) 通过强化学习、动态复杂性跟踪和充分性感知奖励来进一步优化模型,以惩罚过度思考和思考不足。数学、代码和科学基准方面的广泛实验表明,SuCo 在准确性和推理效率方面持续取得了进步。