论文
UniVR:在视觉空间中思考,实现统一视觉推理
UniVR: Thinking in Visual Space for Unified Visual Reasoning
摘要
直接从原始视觉数据中学习广泛的世界知识是智能的一项基本能力。我们介绍 UniVR,这是第一个通过纯视觉演示同时学习复杂推理、细粒度物理动力学和长期规划的研究。 UniVR 的核心特点是 VR-GRPO,这是一种具有互补的全局和阶梯级奖励的强化学习范式。这种方法在整个推理过程中强制逻辑连贯性和物理一致性,而不需要特定于任务的启发法或图像文本对。为了训练和评估 UniVR,我们构建了 VR-X,这是一个从 16 个不同来源策划的大型基准,涵盖长视界操作、空间谜题和物理推理。它是第一个在纯视觉协议下评估这些异构功能的综合套件。值得注意的是,UniVR 比 VR-X 提升了 25%,其卓越的视觉推理能力也提升了各种多模态理解基准的性能。这些发现强调了视觉空间中推理的巨大潜力,所有代码、数据和模型都是开源的以供进一步研究。