论文

ATLAS:主体视觉推理还是潜在视觉推理?一言以蔽之

ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both

模型推理推理策略与问题分解

摘要

视觉推理通常与中间视觉状态交织在一起,已成为该领域的一个有前途的方向。一种简单的方法是在推理过程中通过统一模型直接生成图像,但这在计算上是昂贵的并且在架构上并不简单。最近的替代方案包括通过代码或工具调用进行代理推理,以及通过可学习的隐藏嵌入进行潜在推理。然而,代理方法会因外部执行而产生上下文切换延迟,而潜在方法缺乏任务泛化,并且难以通过自回归并行化进行训练。为了结合它们的优势,同时减轻它们的局限性,我们提出了 ATLAS,一个框架,其中单个离散的“单词”(称为功能标记)既充当代理操作又充当潜在的视觉推理单元。每个功能标记都与内部化的视觉操作相关联,但不需要视觉监督,并且仍然是标记器词汇中的标准标记,可以通过下一个标记预测生成。这种设计避免了冗长的中间视觉内容生成,同时保留了与普通可扩展 SFT 和 RL 训练的兼容性,无需进行架构或方法上的修改。为了进一步解决强化学习期间功能标记的稀疏性问题,我们引入了潜在锚定 GRPO (LA-GRPO),它通过使用静态加权辅助目标锚定功能标记来稳定训练,从而提供更强的梯度更新。大量的实验和分析表明,ATLAS 在具有挑战性的基准测试中实现了卓越的性能,同时保持了清晰的可解释性。我们希望 ATLAS 能够提供一个新的范式来启发未来的视觉推理研究。