论文

PubSwap:联合 RLVR 的公共数据 离策略 协调

PubSwap: Public-Data Off-Policy Coordination for Federated RLVR

模型训练强化学习RLVR

摘要

使用来自可验证奖励的强化学习 (RLVR) 进行推理 后训练 通常是在集中式环境中进行研究,但许多实际应用程序涉及分布在各个组织中的去中心化私有数据。联合训练是一种自然的解决方案,但在这种情况下扩展 RLVR 具有挑战性:全模型同步成本高昂,并且执行许多本地步骤可能会导致异构数据下严重的客户端漂移。我们提出了一个联合 RLVR 框架,它将基于 LoRA 的本地适应与基于公共数据的 离策略 步骤相结合,以提高通信效率和跨客户端协调。特别是,一个小型共享公共数据集用于跨组织定期交换和重用响应级别的训练信号,为实现更加全球一致的目标提供轻量级锚定,而无需暴露私有数据。我们的方法在公共数据步骤中有选择地用全局正确的响应替换局部不正确的响应,从而使训练更接近本地策略,同时仍然受益于跨客户端协调。在数学和医学推理基准和模型中,我们的方法始终优于标准基线。我们的结果强调了联合推理 后训练 的一个简单而有效的方法:将低秩通信与有限的公共数据协调相结合。