论文

Vero:用于一般视觉推理的开放 RL 配方

Vero: An Open RL Recipe for General Visual Reasoning

模型训练强化学习

摘要

构建一个跨图表、科学、空间理解和开放式任务的视觉推理机需要什么?最强大的视觉语言模型(VLM)表明广泛的视觉推理是可以实现的,但其封闭的数据和强化学习(RL)管道使它们的成果难以研究、复制或扩展。我们推出了 Vero,这是一个完全开放的 VLM 系列,它在不同的视觉推理任务中匹配或超过了现有的开放权重模型。我们将 RL 数据和奖励扩展到六大任务类别,构建 Vero-600K(来自 59 个数据集的 60 万样本数据集),并设计处理异构答案的任务路由奖励。在我们的 30 个基准套件 VeroEval 中,Vero-600K 在受控比较下优于现有的 RL 数据集。应用于五个起始模型时,Vero 变体比其初始模型平均获得 2.9-5.4 分。值得注意的是,在 Instruct 模型上训练的 Vero-Qwen3I-8B 在没有额外 蒸馏 的情况下平均超过 Qwen3-VL-8B-Thinking 3.8 分。系统性消融表明,不同的任务类别会引发不同的推理模式,而广泛的收益取决于共同学习而不是孤立学习。所有数据、代码和模型都是公开的。