论文

以偏好替代参数:异构视觉语言模型的联邦对齐

Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models

模型训练奖励建模与过程监督

摘要

视觉语言模型(VLM)在医疗、金融等隐私敏感领域潜力广阔,但严格的数据共享约束使集中式训练不可行。联邦学习以去中心化训练缓解该问题,但实际部署面临客户端在算力、应用需求与模型架构上的异质性挑战。在极端模型与数据异构下,用基于偏好的协作替代参数聚合是更合适的接口,因为它免去直接的参数或数据交换。受此启发,我们提出MoR:结合GRPO与奖励混合(Mixture-of-Rewards)的异构VLM联邦对齐框架。MoR中,每个客户端从本地偏好标注本地训练奖励模型,在不暴露原始数据的情况下捕捉特定评估信号。为组合这些异构监督信号,MoR引入带可学习路由的奖励混合机制,按输入与对齐目标自适应融合客户端奖励模型。服务器随后以GRPO加KL惩罚到参考模型的方式优化基础VLM,实现无需客户端共享架构或参数的偏好对齐。在多样公开视觉语言基准上的实验显示,MoR在泛化与跨客户端适应性上一致超越联邦对齐基线。该方法为联邦 setting 下异构VLM的隐私保护对齐提供可扩展方案。

以偏好替代参数:异构视觉语言模型的联邦对齐:论文配图
图 1:联合 VLM 对齐中偏好异质性的图示。对于相同的驾驶图像和查询,注重细节的客户更喜欢全面的描述,而注重安全的客户更喜欢简洁的危险感知响应,从而导致单一全局奖励模型的奖励信号相互冲突。