论文
以偏好替代参数:异构视觉-语言模型的联邦对齐
Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models
摘要
VLM在医疗与金融等隐私敏感领域具有广泛潜力,但严格的数据共享约束使集中式训练不可行。联邦学习(FL)通过支持去中心化训练缓解这一问题,但实际部署面临客户端在计算资源、应用需求与模型架构上异构的挑战。我们认为,用模型参数替代数据刻画了FL的现在,而用偏好替代参数代表一个更可扩展、更保护隐私的未来。基于这一视角,我们提出MoR,一个基于GRPO与奖励混合(Mixture-of-Rewards)的异构VLM联邦对齐框架。MoR初始化一个视觉基础模型作为KL正则化参考,每个客户端从本地偏好标注本地训练奖励模型,在不暴露原始数据的情况下捕捉特定评估信号。为调和异构奖励,我们引入基于路由的融合机制,自适应聚合客户端奖励信号。最后,服务器以该混合奖励执行GRPO来优化基础VLM。在三个公开VQA基准上的实验表明,MoR在泛化、鲁棒性与跨客户端适应性上持续优于联邦对齐基线。我们的方法为联邦设定下异构VLM的隐私保护对齐提供可扩展方案。
