论文
学习何时思考:面向测试时算力分配的自适应推理
Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation
摘要
用强化学习训练的推理语言模型通常在固定token预算下运行,而非显式自适应的预算,这可能导致在简单问题上计算过度、在困难问题上计算不足。我们研究模型能否学会分配自己的推理努力,即在响应的第一个token选择三种模式之一:NoThink(尽快作答)、Short(简短推理)或 Long(扩展推理)。该选择在 Group Relative Policy Optimization(GRPO)内部学习,无需单独的路由器,通过一个整形奖励使每种模式在不同响应长度下都有价值,再加上每个模式的硬性token上限以保持模式间的区分。在一个在 MATH 上训练的 1.5B 蒸馏模型上,三种模式得以涌现而未坍缩为单一选择,且简短模式的准确率最终高于 Long,这表明路由器是按难度而非随机排序问题。在三个种子上取平均,所得策略在留出的 MATH500 上准确率接近基础模型(0.782 对 0.796),同时把平均响应长度从 4,796 个token降到 2,811 个token(降低 41%)。有趣的是,它无需再训练即可迁移到其他基准,在问题更容易的地方节省最大,例如在 GSM8K 上token减少 76%,且在相似响应长度下准确率高于基线。简言之,我们构建了一个能为每个问题自适应选择推理量的推理模型。
