论文
加强多模态推理以对抗视觉退化
Reinforcing Multimodal Reasoning Against Visual Degradation
摘要
强化学习显着提高了多模态 大语言模型 (MLLM) 的推理能力,但由此产生的策略对于现实世界的视觉退化(例如模糊、压缩伪影和低分辨率扫描)仍然很脆弱。先前来自视觉和深度 RL 的鲁棒性技术依赖于静态数据增强或基于值的正则化,这两种技术都不能干净地转移到自回归 MLLM 的无批评 RL 微调。强化针对此类损坏的推理并非易事:在采样轨迹期间天真地注入降级视图会导致奖励中毒,其中感知遮挡会触发幻觉轨迹并破坏优化的稳定性。我们提出了 ROMA,一种 RL 微调 框架,它修改优化动态以加强针对视觉退化的推理,同时保持干净输入性能。双前向传递策略使用教师强制来根据干净图像轨迹评估损坏的视图,避免在降级输入上进行新的部署。为了分布一致性,我们对最坏情况的增强应用 词元级 代理 KL 惩罚;为了防止正则化下的政策崩溃,以干净图像优势为基础的辅助政策梯度损失保留了可靠的奖励信号;为了避免系统性的错误不变性,以正确性为条件的正则化将执行限制在成功的轨迹上。在 Qwen3-VL 4B/8B 上的七个多模态推理基准测试中,我们的方法将 GRPO 上可见损坏的鲁棒性提高了 2.4%,未见损坏的鲁棒性提高了 2.3%,同时匹配干净的准确性。