论文
TRON:面向视觉推理RL的目标规则可验证在线环境
TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL
摘要
用于视觉推理的强化学习 (RL) 需要可扩展、可验证且可控的训练信号。现有的视觉强化学习后期训练是在静态策划的数据集上进行训练,其中固定的图像-问题-答案样本受其收集预算的限制。在这项工作中,我们介绍了 TRON(有针对性的、规则可验证的在线环境),这是一种在线环境基础:由可控生成器验证程序按需生成训练采样轨迹,该程序对新的潜在视觉状态进行采样、渲染图像、提出问题并准确验证答案。因此,单次运行可以在当前课程所需的难度级别上绘制无限的新实例流。目前的 TRON 套件包含 520 个环境,分为五个能力桶(空间、数学、图表、模式/逻辑和计数);相同的基质支持在所有桶上训练的单个完整模型和每个桶的能力专家模型,无需额外的数据收集。我们还介绍了一种基质分析,涵盖生成可靠性、实例和级别多样性、跨环境近似重复以及按难度级别划分的基本模型通过率。使用 METHOD 的 RL 后训练持续提高了 Qwen3-VL-4B、Qwen2.5-VL-7B 和 MiMo-VL-7B-SFT 的 10 个外部多模态推理基准的性能。