论文

Trace:用于多域视觉推理的分类引导环境

Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

模型训练合成数据

摘要

可验证奖励的强化学习(RLVR)极大地改进了语言模型推理,但其向视觉语言模型的扩展仍然受到缺乏同时广泛、可精确验证和可重复的训练数据的限制。我们介绍 Trace,一个用于多域视觉推理的分类引导环境。 Trace 将任务构建分解为场景语法和可执行任务程序,将视觉实现与答案计算分开。共享语义状态决定渲染图像、提示、键入的答案、验证者状态和可重播实例跟踪。生成的环境包含超过 277 个场景语法和 11 个视觉域的 1,000 个任务,具有受控的语义和视觉变化。 64,000 个 Trace 实例上的 RLVR 将 24 个外部基准的宏观平均值提高了 Qwen2.5-VL-3B 3.51 个百分点,Qwen2.5-VL-7B 提高了 4.06 个百分点,这提供了证据表明广泛的程序训练可以超越生成的任务分布。项目页面:https://mavern.github.io/trace/。