论文
BPPO:具有简洁响应的高效 GRPO 式推理 RL 的二进制前缀策略优化
BPPO: Binary Prefix Policy Optimization for Efficient GRPO-Style Reasoning RL with Concise Responses
摘要
组相对策略优化 (GRPO) 广泛用于训练推理模型,但更新每个组中的所有采样完成会产生大量成本,并且会强化详细的推理轨迹。在本文中,我们研究了 GRPO 式推理 RL 中所有补全是否都提供同样有用的更新信号。我们的梯度相似性分析表明,在同一提示组内,同类完成通常会引起高度相似的更新方向,而正确-错误对提供更明显的对比信号。受此观察的启发,我们提出了二进制前缀策略优化(BPPO),它使用最短的正确完成和最短的错误完成作为紧凑的更新单元,同时保留全组优势标准化。 BPPO通过自适应完成调度和以前缀为中心的优化进一步提高效率;通过仅更新响应前缀,它可以避免强化冗余后缀并鼓励更简洁的响应。在 GSM8K、MATH 和 Geo3K 上的实验表明,BPPO 在保持有竞争力的准确性的同时,比 GRPO 实现了高达 6.08 倍的加速,并将平均响应长度减少了大约 30-50%,而无需通过显式长度惩罚来修改奖励。