论文

DUEL:多模态推理的对抗性自我对弈

DUEL: Adversarial Self-Play for Multimodal Reasoning

模型训练强化学习

摘要

强化学习(RL)已成为提高视觉语言模型(VLM)推理能力的有效范例。然而,基于强化学习的优化通常依赖于难以扩展的昂贵的高质量注释。由于视觉基础薄弱和缺乏可靠的验证信号,现有的无监督替代方案可能会转向有偏见的解决方案。我们提出了一个自我进化的 后训练 框架 DUEL,其中监督是从同一预训练 VLM 初始化的两个策略之间的对抗性交互中产生的。挑战者生成基于图像的真实主张以及扰动最小的硬负对应物,而解决者则根据图像验证这两种主张,鼓励在近邻语义下进行细粒度的视觉辨别。为了稳定优化,我们引入了长度归一化的对数似然奖励,它保留了二进制结果监督之外的信息优化信号,并提高了稀疏反馈下的学习稳定性。实验表明,DUEL 持续改进视觉推理和强大的辨别力,无需额外的人工注释、外部奖励模型或图像编辑工具。