论文

以偏好替代参数:异构视觉-语言模型的联邦对齐

Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models

模型训练强化学习

摘要

VLM在医疗与金融等隐私敏感领域具有广泛潜力,但严格的数据共享约束使集中式训练不可行。联邦学习(FL)通过支持去中心化训练缓解这一问题,但实际部署面临客户端在计算资源、应用需求与模型架构上异构的挑战。我们认为,用模型参数替代数据刻画了FL的现在,而用偏好替代参数代表一个更可扩展、更保护隐私的未来。基于这一视角,我们提出MoR,一个基于GRPO与奖励混合(Mixture-of-Rewards)的异构VLM联邦对齐框架。MoR初始化一个视觉基础模型作为KL正则化参考,每个客户端从本地偏好标注本地训练奖励模型,在不暴露原始数据的情况下捕捉特定评估信号。为调和异构奖励,我们引入基于路由的融合机制,自适应聚合客户端奖励信号。最后,服务器以该混合奖励执行GRPO来优化基础VLM。在三个公开VQA基准上的实验表明,MoR在泛化、鲁棒性与跨客户端适应性上持续优于联邦对齐基线。我们的方法为联邦设定下异构VLM的隐私保护对齐提供可扩展方案。

以偏好替代参数:异构视觉-语言模型的联邦对齐
图2:我们提出的联邦框架架构概览。该框架由三个相互连接的阶段组成:(A) 去中心化奖励模型训练:各个客户端在其私有、领域特定的数据集上独立训练本地奖励模型(RM)。(B) 联邦路由器训练:在客户端之间协同训练一个全局路由机制,学习如何将输入分派给最有能力的本地 RM。(C) GRPO 策略对齐:最终的多模态策略使用 Group Relative Policy Optimization(GRPO)进行优化,由训练好的路由器选择的高质量奖励信号引导。