论文

超越模型扩展:面向高效深度推理的测试时干预

Beyond Model Scaling: Test-Time Intervention for Efficient Deep Reasoning

模型推理模型训练强化学习测试时计算扩展RLVR

摘要

大型推理模型(LRM)擅长多步推理,但常受过度思考与过度推进等低效推理过程困扰,其中过多或方向错误的推理既增加计算成本又损害性能。现有高效推理方法以闭环方式运作,缺乏外部干预机制来引导推理过程。为此,我们提出 Think-with-Me,一种在推理过程中引入外部反馈干预的新型测试时交互式推理范式。我们的核心洞见是:过渡连词是天然的干预点,它们标示自验证或探索阶段的开始;适当使用过渡词延长推理可提升性能,而过度使用则影响性能。基于这些洞见,Think-with-Me 在这些节点暂停推理以获取外部反馈,自适应地延长或终止推理,在保持准确率的同时减少冗余。反馈通过多准则评估(合理性与完整性)生成,来源可以是人类或 LLM 代理。我们使用 Group Relative Policy Optimization(GRPO)训练目标模型以适应这种交互模式。实验表明,Think-with-Me 在有限上下文窗口下实现了准确率与推理长度的更优平衡。在 AIME24 上,Think-with-Me 在 8K 窗口下准确率超过 QwQ-32B 7.19%,同时平均推理长度减少 81%。该范式也惠及安全与创意任务。

超越模型扩展:面向高效深度推理的测试时干预
图2:Think-with-Me 的示意图。给定一个问题,LRM 生成推理并被暂停,直到遇到特定触发词。随后由基于 LLM 的评估器或人类评估推理的合理性与完整性,并插入以标签包裹的反馈。LRM 基于更新后的上下文继续推理。该过程反复进行,直至达到最大次数,或生成 </think> 以结束推理并产生最终答案。