论文

基于思考的非思考:通过强化学习解决混合推理模型训练中的奖励作弊问题

Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning

模型训练强化学习

摘要

大型推理模型(LRM)因其卓越性能而备受关注。然而,其性能主要来自思考,即一条较长的思维链(CoT),这会显著增加计算开销。为解决这一过度思考问题,现有工作聚焦于使用强化学习(RL)训练混合推理模型,使其根据查询复杂度自动决定是否进行思考。遗憾的是,使用强化学习会遭遇奖励作弊问题,例如模型进行了思考却被判定为未思考,从而得到错误奖励。为缓解这一问题,现有工作要么采用监督微调(SFT),但会带来高昂的计算成本,要么对非思考响应施加统一的token上限,但对问题的缓解效果有限。本文提出Thinking-Based Non-Thinking(TNT)。它不使用SFT,而是利用使用思考的响应中解答部分的信息,为不同查询下不使用思考的响应设置不同的最大token用量。在五个数学基准上的实验表明,与DeepSeek-R1-Distill-Qwen-1.5B/7B和DeepScaleR-1.5B相比,TNT将token用量减少约50%,同时显著提升准确率。事实上,在所有受测方法中,TNT在准确率与效率之间取得了最优权衡。此外,在所有受测数据集上,TNT被归类为不使用思考的响应中出现奖励作弊问题的概率始终低于10%。

基于思考的非思考:通过强化学习解决混合推理模型训练中的奖励作弊问题 配图
图 1:TNT 概览。