论文

测量和缓解 RLVR 中的解决方案模式崩溃

Measuring and Mitigating Solution Mode Collapse in RLVR

模型训练模型评测强化学习基准与评测资源

摘要

语言模型 (LM) 通常可以通过多种方式回答同一问题,但具有可验证奖励的强化学习 (RLVR) 与模型产生的正确答案无关。无论是熟悉答案的第一千个副本还是模型以前从未生成过的解决方案,都将获得相同的奖励。然而,让模型在训练时保留多个正确的解决方案具有潜在的价值。例如,多种模式可以为用户提供选择并提供提高整体模型性能的问题解决策略。在这里,我们介绍了 ModeBench,它是多解决方案任务的基准,其中验证者返回正确性和发现的模式。然后,我们使用 ModeBench 来测量 RLVR 训练后解决方案多样性的变化。我们发现,即使准确性保持或提高,RLVR 后训练也会将概率集中到较少的正确模式上,而且,前沿模型已经高度集中。然后我们介绍我们的解决方案 Re:Max,它将每个发现的模式存储一个经过验证的示例在重播缓冲区中并进行训练 统一在那些存储的模式上。因此,一次找到的解决方案与重复找到的解决方案一样需要经常实践。在三个模型尺度、两个强化学习目标和更难的任务构建中,重放提高了策略成功的频率以及成功的不同方式。