论文

VICO:视觉语言模型推理的视觉环境共同进化

VICO: Visual Environments Co-Evolving for Vision-Language Model Reasoning

模型训练强化学习合成数据

摘要

具有可验证奖励的强化学习 (RLVR) 已成为训练后视觉语言模型 (VLM) 的标准配方,但它通常假设静态训练环境。随着行动者的进步,固定任务会逐渐脱离其学习边界:许多任务变得微不足道,而另一些任务仍然无法解决;学习信号崩溃。我们认为 VLM 后训练应该与演员一起发展视觉环境,而不仅仅是演员本身。我们提出了 VICO,一个协同进化框架,其中参与者和环境重写器(EnvRewriter)被联合训练:EnvRewriter 编辑可验证的图像侧结构,例如场景图、图表或受保护区域掩模,并重新渲染它们以生成标签有效的训练样本,其难度通过基于通过率的奖励来校准到参与者当前的能力。该循环不断地根据参与者的能力重新调整任务难度,而无需任何额外的人工注释。在跨越数学推理和视觉基础理解的九个多模式基准测试中,VICO-8B 的改进超过 其基本模型在域外任务上的性能提升高达 +5.0%,分别超过最强的自进化和文本编辑协同进化基线 +4.3% 和 +8.4%,并且与使用少 16-160 倍标记样本的图表专用 RLVR 方法保持可比性。通过从人工标记监督转向图像编辑共同进化,VICO 为视觉推理提供了一条超越静态语料库 RLVR 的可扩展路径。