论文

When2Think:按难度学习混合推理长度控制

When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models

模型训练强化学习

摘要

大推理模型在复杂任务中表现强劲,却存在系统性低效:简单问题常过度思考,困难问题思考不足。统一长度惩罚或刚性路由方法会付出效率代价,以简单样本计算减少换取困难样本准确率损失。我们将高效推理表述为实例自适应计算分配问题,提出按问题难度动态分配计算的混合推理后训练框架When2Think。其引入实例级难度感知控制IDAC,通过预计算参考统计(准确率与Token用量)进行奖励塑形,调节推理深度。结合基于验证器的奖励和批次标准化优势,IDAC无需学习奖励模型或在线查询参考模型,即可稳定进行无评论家优化。When2Think鼓励简单样本直接作答,同时为困难样本保留扩展推理,学习何时使用系统1(NoThink)或系统2(Think)。数学基准显示更好的准确率—效率权衡:相对基座,AIME24的Pass@3提高10.0%,Token用量减少27.9%;在AIME25上达到40.0% Pass@3,优于压缩及仅路由基线。

When2Think:按难度学习混合推理长度控制:论文配图
图 2:用于自适应混合推理的 When2Think RLVR 框架概述。该框架包括两个阶段。 (左)参考预计算:参考策略 πref\pi_{\mathrm{ref}} 为每个输入 xix_{i} 生成轨迹,以估计实例级难度 αi\alpha_{i} 和预期推理成本 τi\tau_{i}。 (右)使用重要性采样进行训练:探索分布 πIS\pi_{\mathrm{IS}} 通过均匀采样初始模式令牌来强制 Think(显式推理)和 NoThink(直接回答)之间的平衡探索,而后续令牌则由策略 πθ\pi_{\theta} 生成。