论文
SD-MAR:通过合成数据和强化学习进行多图像分析推理
SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning
摘要
视觉语言模型 (VLM) 表现出强大的感知能力,但在需要跨多个视觉状态进行分析推理的任务中仍然受到限制,例如多图像比较、变化检测和多步骤视觉推理。这些功能对于现实世界的多模式应用至关重要,其中推理必须基于视觉上下文之间的系统差异。然而,现有的基准测试很少需要明确的视觉比较和分析推理,因此这种能力尚未得到充分开发。为了解决这一差距,我们引入了 SD-MAR(多图像分析推理的合成数据),这是一个用于训练和评估多图像分析推理 VLM 的框架。 SD-MAR 通过受控扰动构建配对视觉场景,并生成涵盖语义变化归因和定量比较的推理任务。我们使用带有向后折扣分配(BDA)的 GRPO-lite 进一步训练 VLM,这是一种强化学习方法,消除了 KL 正则化以鼓励更强的策略优化,同时为形成分析结论的后续推理步骤分配更多的功劳。在 Qwen2.5-VL-7B 和 InternVL3-8B 上的实验表明,SD-MAR 上的 GRPO-lite 微调 将域内准确率提高了 36.95%,其中 Qwen2.5-VL-7B 在 SD-MAR 基准上的表现优于 GPT-4.1。重要的是,域外泛化得到保留或改进:在 MME、MMMU-Pro 和 MathVista 上性能保持在 1% 以内,而在 MMBench 上提高高达 4%。 LLM 作为法官的评估进一步证明了两个模型在逻辑一致性和解释质量方面的持续改进。