论文
VISTA:交互式世界中推理的视觉工具
VISTA: A Visual Harness for Reasoning in an Interactive World
摘要
我们表明,多模态模型具有强大的推理能力,并且适当的利用可以释放其在不同交互环境中解决任务的潜力。我们推出 VISTA,这是一种视觉工具,可为通用多模态模型提供长程。 VISTA 允许模型通过视觉观察直接感知环境,并保持无损的视觉记忆,以原始形式保留过去的观察结果。该模型可以主动检索这些观察结果,并根据推理重新组织其视觉输入。在 ARC-AGI-3 上,VISTA 将 Claude Opus 5.0 的相对人类动作效率得分从 40.68 提高到完美的 100.00,该模型完成所有 25 场公开游戏的动作比首次人类参与者少了 57.4%。 VISTA 的简单设计也使其能够以最小的适应自然地扩展到多样化的视觉环境。在涵盖各种视觉游戏和谜题的三个附加基准中,它的性能大大优于使用相同底层模型和最少控制的基准。我们的结果凸显了 VISTA 作为通用视觉工具的潜力,可在复杂的视觉环境中推进多模态Agent。