论文

选择性迁移强化学习更新以改善视觉推理

Selective Transfer of RL Updates for Visual Reasoning

模型优化模型合并

摘要

模型合并提供了一种 无需训练方式将推理功能从语言模型转移到视觉语言模型 (VLM),但基于端点的转移可以将预先存在的模型差异与推理 后训练期间获得的更改合并起来。相反,我们围绕训练阶段更新制定能力转移,从而隔离强化学习 (RL) 引起的参数变化。然而,完全传输此更新仍然不是最理想的:我们发现其组件在跨模型可传输性方面存在很大差异,主导方向传输比完整更新更有效。基于这一发现,我们引入了 Selective-RL,它隔离了 RL 阶段的更新,保留了其主要的矩阵方向并保留了幅度,并将它们转移到 VLM 的语言模块中。在三个模型系列和五个视觉推理基准中,Selective-RL 在 15 次比较中的 12 次中改进了完全更新插值,包括 Qwen 接收者的 MathVision 提高了 8.55 个百分点。匹配的控制表明,仅更新幅度或任意低等级并不能重现这些增益。这些结果突出了 后训练期间获得的内容与跨模型可迁移的内容之间的区别,提供了跨模型能力迁移的训练阶段视角。代码可在 https://anonymous.4open.science/r/selective-rl. 获取

选择性迁移强化学习更新以改善视觉推理:论文原图
图 1:选择性 RL 更新传输。四个阶段隔离 $R-B$,选择矩阵方向,恢复其 Frobenius 范数,并将其与接收者组合。插值包括初始化位移;直接相加则省略。矩阵图案是示意性的。