论文

AtlasVLA:视觉-语言-动作模型的持久世界-自我状态建模

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

上下文与知识上下文工程

摘要

虽然视觉-语言-动作(VLA)模型具有先进的具体人工智能,但其基本的反应范式严重限制了部分可观察和长期任务的性能。当仅限于单个腕式摄像头时,当物体退出视野时,它们不可避免地会出现感知遗忘,并且在多步骤执行期间会出现暂时的任务进度遗忘。为了克服这些瓶颈,我们提出了 AtlasVLA,这是一种新颖的框架,通过持久的世界自我状态从直接反应性操纵过渡到主动推理。 AtlasVLA 采用双内存架构:4D 持久世界状态内存,将瞬态 2D 观察提升到全局更新的体素哈希空间状态,以解决视觉盲点;以及自我工作状态内存,跟踪历史自我状态和任务进度。通过在这个联合世界-自我状态上调节扩散 Transformer (DiT),AtlasVLA 能够实现强大的空间推理。对 LIBERO、RLBench 和现实世界基准的广泛评估表明,AtlasVLA 仅使用腕式摄像头即可实现最先进的性能。值得注意的是,它的性能明显优于多视图基线,在 LIBERO-Long 上的绝对成功率提高了 9.4%,在现实世界的长视野任务中提高了 17.5%。