论文
超越模型扩展:面向高效深度推理的测试时干预
Beyond Model Scaling: Test-Time Intervention for Efficient Deep Reasoning
摘要
大型推理模型(LRM)擅长多步推理,但常受过度思考与过度推进等低效推理过程困扰,其中过多或方向错误的推理既增加计算成本又损害性能。现有高效推理方法以闭环方式运作,缺乏外部干预机制来引导推理过程。为此,我们提出 Think-with-Me,一种在推理过程中引入外部反馈干预的新型测试时交互式推理范式。我们的核心洞见是:过渡连词是天然的干预点,它们标示自验证或探索阶段的开始;适当使用过渡词延长推理可提升性能,而过度使用则影响性能。基于这些洞见,Think-with-Me 在这些节点暂停推理以获取外部反馈,自适应地延长或终止推理,在保持准确率的同时减少冗余。反馈通过多准则评估(合理性与完整性)生成,来源可以是人类或 LLM 代理。我们使用 Group Relative Policy Optimization(GRPO)训练目标模型以适应这种交互模式。实验表明,Think-with-Me 在有限上下文窗口下实现了准确率与推理长度的更优平衡。在 AIME24 上,Think-with-Me 在 8K 窗口下准确率超过 QwQ-32B 7.19%,同时平均推理长度减少 81%。该范式也惠及安全与创意任务。
