论文
FGRPO:对非 IID 数据进行自适应聚合的联合 GRPO
FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data
摘要
语言模型的最新进展已将强化学习确立为引发自我纠正和长链推理的主要范例。虽然组相对策略优化 (GRPO) 通过消除批评者网络提供了卓越的可扩展性,但将其部署在中央基础设施上需要从分布式所有者收集大量数据,这会带来重大的隐私风险。为了解决这些问题,我们引入了联邦 GRPO (FGRPO),这是一个旨在跨异构数据所有者分散 微调 推理模型的框架。为了有效减轻异构任务奖励尺度不同造成的不稳定性,FGRPO 结合了基于相对性能增益的自适应聚合机制。通过描述每个客户相对于其个性化历史基线的改进,该框架动态地优先考虑有效的学习轨迹,无论本地任务难度如何。 FGRPO 确保非 IID 数据的稳健收敛,同时保护数据隐私。