论文

ReflectRL:通过反思到直接推理学习高价值负面轨迹

ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning

模型训练强化学习

摘要

强化学习训练方法已作为大语言模型提升推理能力的一种强大后处理方法,并常通过更强专家模型的金标准轨迹加以增强。然而,当专家在更难的问题上失败时,现有的轨迹引导方法失去其主要监督来源,并通常将这些失败的轨迹视为负面样本丢弃。我们认为,在这种情况下,这些失败,我们称之为“金标准负向轨迹”,仍然可以提供有价值的推理信号,而不仅仅是作为模仿示例来学习,而是作为反映不足的轨迹来反思。我们识别出一个反射优势:对于难题来说,反思一个错误的轨迹比从头开始解决问题要容易且更有效。受此启发,我们提出了ReflectRL,这是一种轻量级、插件式框架,在强化学习训练过程中使用金标准负向轨迹进行学习。ReflectRL首先使用这些轨迹来激发反思性推理,然后应用反射到直接政策转移将获得的推理行为带回直接推理。在9个基准测试集、4种大语言模型架构和4种强化学习训练方法上进行实验,结果表明ReflectRL在不增加额外开销的情况下显著提高了推理性能。

ReflectRL:通过反思到直接推理学习高价值负面轨迹:论文配图
图 2:ReflectRL 概述。失败的专家轨迹被用作黄金负轨迹来引发反思推理。 ReflectRL在on-policy训练期间将反思推理与直接推理相结合,并应用反思到直接策略转换将获得的推理行为转移回原始问题设置。