论文

超越分布锐化:任务奖励的重要性

Beyond Distribution Sharpening: The Importance of Task Rewards

模型训练强化学习

摘要

将基于任务奖励的强化学习 (RL) 集成到其训练流程中后,前沿模型展示了卓越的功能,使系统能够从纯粹的推理模型发展为复杂的智能体。然而,关于强化学习是否真正在基本模型中灌输新技能,还是仅仅强化其现有分布以激发潜在能力,仍然存在争论。为了解决这种二分法,我们对分布锐化和基于任务奖励的学习进行了明确的比较,利用强化学习作为实现这两种范式的工具。我们的分析揭示了分布锐化的固有局限性,从第一原理证明了最优值如何以及为何可能不利,并且该方法从根本上不稳定。此外,我们在数学数据集上使用 Llama-3.2-3B-Instruct、Qwen2.5-3B-Instruct 和 Qwen3-4B-Instruct-2507 进行的实验证实,锐化产生的收益有限,而结合基于任务的奖励信号可以极大地帮助实现稳健的性能改进和稳定的学习。