论文

VBVR-Pro:用于本机视觉推理的可扩展且可验证的套件

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

模型评测基准与评测资源

摘要

原生视觉推理将视觉生成视为推理本身的媒介:视觉状态(即图像和视频)不仅仅是要理解的输入或要呈现的输出,而是解决语言之外的问题的一流基础。然而,由于缺乏可扩展的训练任务、可靠的反馈和跨生成基质的受控比较,进展仍然受到瓶颈。在这项工作中,我们介绍了 VBVR-Pro,这是一个闭环测试平台,可以通过生成来实现本机视觉推理的可训练、可验证、可优化和实验可控。 1)任务扩展。 VBVR-Pro 将视觉推理转变为由 300 个程序生成的任务组成的受控任务空间。在 VBVR-Pro 上训练的模型在 RISE-Video、MME-CoF-Pro 和 BabyVision 等七个外部视觉推理基准测试中表现出超出提议套件的强大迁移能力。 2)可验证的奖励。 VBVR-Pro 为基于任务的评估提供可验证的奖励评分器。通过对作为法官的领先 MLLM 进行系统研究,我们确定了流行的 VLM 作为法官范式的反复出现的失败模式。相比之下,所提出的评分器基于确定性的、特定于任务的规则,实现与人类判断的细粒度一致。重要的是,它们可以作为大规模多任务强化学习的可靠奖励信号,并在视觉推理任务中表现出更强的强化学习后性能。 3)机理研究。 VBVR-Pro 支持跨 30 多种图像、视频和交错发生器进行受控模态研究。我们的分析表明,视频生成对于需要持续时空状态跟踪的任务来说仍然是最强的,而交错生成提供了一种计算效率高的替代方案。至关重要的是,消融和探测表明存在对视觉推理至关重要的视觉原生轨迹。我们发布所有数据、模型、评分器和代码。