论文
先看后回答:通过充分性驱动的强化学习进行视觉证据预对齐
See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL
摘要
多模态 大语言模型 (MLLM) 将强大的文本推理与视觉输入相结合,但它们的响应可能与底层图像不一致,这表明在推理过程中视觉证据的利用无效。流行的训练范例依赖于大规模基于图像描述的预训练来进行一般对齐,然后是监督 微调 和强化学习来实现指令跟踪和复杂推理。然而,这种预训练只提供了较弱的视觉证据关联:简短、粗略的图像描述使模型偏向于显着的对象,同时忽略了细粒度的视觉证据。在本文中,我们介绍了视觉证据预对齐(VEPA),这是预训练和 后训练 之间的中间阶段,它探索了一种新颖的充分性驱动目标与组相对策略优化(GRPO)来优化问题条件视觉证据描述。跨不同基准的广泛实验表明,我们的 VEPA 持续增强了视觉要求较高的评估的性能,并补充了标准监督 后训练。进一步的分析表明,收益来自于强化的、可转移的视觉证据关联,而不是来自额外的针对特定任务的训练。