论文

F-TIS:在协作 GRPO 中利用多种模型

F-TIS: Harnessing Diverse Models in Collaborative GRPO

模型训练强化学习

摘要

GRPO 等强化学习方法在 LLM 后训练 中得到了广泛的应用。在 GRPO 中,模型会生成一组提示的完成结果,并给予奖励,并且策略会针对相对较高的奖励完成情况进行更新。由于模型的自回归性质,这种训练方式的生成阶段可能非常耗时。作为一种解决方案,先前的工作试图将推理步骤分布在许多节点上,并行工作。这些工作在训练中主要假设同质模型,以便使样本尽可能接近 同策略。这种假设在去中心化系统中可能不切实际,在去中心化系统中,具有不同计算和偏好的各方可能希望在同一任务上进行协作。因此,去中心化训练需要一种能够处理异构模型的方法——不同的模型在相同的任务上进行协作。然而,这导致在训练期间出现高度 离策略 样本,先前的工作已确定 离策略 样本会损害 GRPO 收敛。为了实现异构性,我们提出了过滤截断重要性采样(F-TIS)——一种 GRPO 风格的训练范例,可以使用 离策略 样本来改进本地模型的学习。我们的框架允许各种模型在同一个 RL 训练运行中进行协作,同时保持高效的通信。我们在各种异构设置中广泛评估 F-TIS,并表明它表现出与纯样本训练相同的最终模型收敛性。此外,我们在某些设置中观察到,与 同策略 训练相比,对分布外任务的泛化效果更好,将模型的性能提高了 12%。