论文

ExTra:语言模型强化学习的探索性轨迹优化

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

模型训练强化学习

摘要

用于语言模型推理的可验证奖励强化学习(RLVR)可能会在任务难度的两个极端上失败:简单的提示通常会产生完全正确、低多样性、梯度信号很少的采样轨迹组,而困难的提示可能会产生完全不正确的组,没有积极的奖励。我们引入了 ExTra(探索性轨迹优化),这是一个与 GRPO 兼容的框架,可以从模型自身的采样轨迹中提取探索信号。 ExTra 结合了两种机制:(i)一种新颖的奖励,在 GRPO 标准化后添加基于嵌入的多样性奖励,奖励不同的正确解决方案; (ii) 熵引导的前缀再生,它使用熵信号对部分轨迹进行评分,并从有希望的中间步骤继续探索。在六个数学推理基准测试中,ExTra 在 pass@1 上比 GRPO 提高了约 +5 点,在 pass@16 上提高了 +7 点,表明轨迹级探索信号可以提高单样本精度和推理时间覆盖率。