论文

奖励有效推理可以提高推理模型中未指定任务的放弃率

Rewarding Efficient Reasoning Improves Abstention on Underspecified Tasks in Reasoning Models

模型训练强化学习

摘要

虽然现代大型推理模型(LRM)擅长在许多任务中提供正确答案,但我们提供了额外的证据来证明它们经常在关键能力上遇到困难:知道何时放弃回答。我们通过将 LRM 行为与人类研究结果进行比较来分析这一差距,揭示人类对无法回答的任务的推理努力受到可回答任务的上限限制,而 LRM 通过在无法回答的提示上生成比可回答的提示更长的思维链 (CoT) 来浪费计算资源。为了克服这种低效率,我们从人类认知的资源理性角度获得灵感,并引入一种新颖的 GRPO 奖励,鼓励有效推理任务是否包含解决该任务所需的所有信息。使用此奖励对多个 4B LRM 进行微调,可以实现类似人类的弃权性能增益(平均 +12.8%),同时保留回答能力并提高模型效率(平均 CoT 缩短 44%)。