论文

Nice Fold还是Hero Call:面向自适应推理的预算高效思考学习

Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning

模型训练强化学习RLVR

摘要

大型推理模型(LRM)通过延长推理提升问题解决能力,但常常错误分配测试时算力。现有的效率方法通过压缩推理轨迹或依据感知难度调节预算来降低成本,却在很大程度上忽视了可解性。结果是,它们可能把大量预算花在超出模型能力的问题上,同时却压缩了那些需要更深推理、难但可解的问题。在本工作中,我们将自适应推理形式化为不确定性下的计算投资,其中预算应跟随推理的期望回报,而不仅取决于感知难度。为落地这一原则,我们提出Budget-Efficient Thinking(BET),一个两阶段框架,将行为冷启动与投资成本感知奖励下的GRPO相结合。通过将“求解还是弃答”的决策与由rollout估计的可解性对齐,BET学会三种行为:(1) short solve,简洁回答简单问题;(2) nice fold,在继续推理的期望回报趋近于零时尽早放弃;(3) hero call,为难但可解的问题保留充足算力。在七个基准和三个基座模型上,BET平均减少约55%的推理token,同时取得整体性能提升,并能从数学推理零样本迁移到科学问答和逻辑推理,获得相近的效率收益。

Nice Fold还是Hero Call:面向自适应推理的预算高效思考学习:论文配图
图 1:Omni-Math 的推理行为和准确性-效率权衡。 (a) Easy、Worthy 和 Unsolvable 对应于 16/16、1–15/16 和 0/16 正确的原版部署。 Vanilla LRM 对简单的查询过度思考,对无法解决的查询过度分配,而先前的自适应方法常常过早地限制有价值的推理。 (b) 押注于帕累托边界,保留有价值的推理,同时减少无法解决的查询上的浪费。