论文

异构语言模型互强化学习经验分享

Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models

模型训练强化学习

摘要

我们引入了互强化学习,这是一种并发 RL 后训练 的框架,其中异构 LLM 策略交换类型化经验,同时保持单独的参数、目标和标记器。该框架结合了共享经验交换 (SEE)、多工作人员资源分配 (MWRA) 和标记器异构层 (THL),该标记器异质性层 (THL) 重新标记文本并跨不兼容的词汇表对齐 词元级 跟踪。该基底使得经验共享设计问题可以跨模型系列运行。我们在 GRPO 之上实例化三个受控探针:通过对等转出池 (PRP) 进行数据级转出共享、通过跨策略 GRPO 优势共享 (XGRPO) 进行价值级优势共享,以及通过成功门控转移 (SGT) 进行结果级成功转移。上下文强盗分析描述了它们在稳定性与支持权衡中的结构立场:PRP 支付密度比方差和 THL 剩余成本,XGRPO 保留 同策略 参与者支持,同时改变标量基线,SGT 提供救援集分数方向以验证同行成功。在评估制度中,结果层面的共享占据了这种权衡的有利点。