论文
When2Think:按难度学习混合推理长度控制
When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models
摘要
大推理模型在复杂任务中表现强劲,却存在系统性低效:简单问题常过度思考,困难问题思考不足。统一长度惩罚或刚性路由方法会付出效率代价,以简单样本计算减少换取困难样本准确率损失。我们将高效推理表述为实例自适应计算分配问题,提出按问题难度动态分配计算的混合推理后训练框架When2Think。其引入实例级难度感知控制IDAC,通过预计算参考统计(准确率与Token用量)进行奖励塑形,调节推理深度。结合基于验证器的奖励和批次标准化优势,IDAC无需学习奖励模型或在线查询参考模型,即可稳定进行无评论家优化。When2Think鼓励简单样本直接作答,同时为困难样本保留扩展推理,学习何时使用系统1(NoThink)或系统2(Think)。数学基准显示更好的准确率—效率权衡:相对基座,AIME24的Pass@3提高10.0%,Token用量减少27.9%;在AIME25上达到40.0% Pass@3,优于压缩及仅路由基线。
