论文
Fed-GRPO:用奖励信号协调联邦推理训练
Fed-GRPO: Reward-Signal-Driven Federated Group Relative Policy Optimization
摘要
大型语言模型 (LLM) 在通过强化学习 (RL) 进行微调时表现出强大的推理能力,特别是通过组相对策略优化 (GRPO)。然而,现有的 GRPO 方法假设集中访问训练数据,但由于隐私或监管限制,这在实践中可能不成立。为此,我们提出了 Fed-GRPO,这是一个联邦 GRPO 训练框架,通过在不共享原始数据的情况下实现协作推理训练来解决这些隐私限制,该框架利用 GRPO 训练期间自然产生的奖励统计数据作为零成本信号来指导聚合、本地训练和通信。 Fed-GRPO 包含三种奖励信号驱动机制:(i)\emph{信号加权聚合},通过奖励标准差对客户进行加权,优先考虑具有更强学习信号的客户; (ii) \emph{全局奖励校准},根据局部-全局奖励差距重新加权每个提示目标,引导每个客户针对其相对弱点; (iii) \emph{自适应稀疏通信} 根据每个客户端更新的信息量分配带宽。对数学推理任务的大量实验表明,Fed-GRPO 在所有联邦方法中实现了最佳性能,明显优于 FedAvg 并接近集中式训练性能,同时无损地减少了 32\times$ 的通信量,并在带宽预算紧张的情况下支持高达 621\times$ 的压缩,精度仅略有下降。我们的代码可在 https://github.com/HKU-HealthAI/Fed-GRPO. 获取