论文

自我质疑的视觉语言模型:组合视觉推理的强化学习

Self-Questioning Vision-Language Models: Reinforcement Learning for Compositional Visual Reasoning

模型训练强化学习

摘要

视觉语言模型 (VLM) 是处理图像和文本的人工智能系统,但它们经常难以解决组合视觉推理问题,这些问题需要将多个步骤链接在一起,例如识别对象、计数和比较结果。现有方法通过根据人类编写的逐步解释训练模型来改进这种推理,但创建这些注释成本高昂且难以扩展。我们提出了一种自我提问框架,使用称为组相对策略优化 (GRPO) 的强化学习算法,训练 VLM 将视觉问题分解为更小的子问题,并在生成最终响应之前回答每个问题。该模型从未展示过如何分解问题的示例,而是在奖励信号的指导下自行发现这种行为,该奖励信号对输出是否包含子问题以及最终答案是否正确进行评分。我们将此框架应用于 30 亿参数的模型,在几何形状的合成场景 (CLEVR) 和真实世界照片 (A-OKVQA) 上进行训练。在 A-OKVQA 上,自我提问和标准强化学习都比未经训练的模型显着提高了准确性(分别为 52.2% 和 51.6% vs. 46.8%)。我们引入了第一个自我提问 VLM,不仅像标准 RL 一样奖励最终答案,而且还生成中间子问题,使其能够发现组合分解策略。这些结果表明,教人工智能系统问自己中间问题是复杂视觉推理的一种有前途的策略,特别是当问题的难度需要明确的逐步分解时。