论文
EventVLA:事件驱动的视觉证据记忆,用于长期愿景-语言-行动政策
EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies
摘要
内存仍然是长视野机器人操作的关键瓶颈,因为当任务相关线索随着时间的推移被遮挡或不可观察时,标准视觉-语言-动作(VLA)策略通常会失败。虽然现有的记忆增强方法利用历史背景,但它们要么遭受严重的信息瓶颈,通过解耦双系统导致高延迟,要么依赖积累大量视觉冗余的非选择性缓冲区。为了解决这些限制,我们引入了 EventVLA,这是一个基于稀疏视觉证据记忆概念的端到端框架,包含两个核心组件:保留初始和短期上下文的基础视觉锚点,以及动态关键帧证据记忆(KEM)模块。具体来说,KEM 直接从 VLA 的潜在嵌入预测未来关键帧概率,以自主捕获和存储稀疏的任务关键型视觉事件。这种前瞻性驱动的机制使政策能够动态评估当前观察结果的未来因果效用,在短暂的视觉证据变得不可观察之前保留它。此外,我们提出了 RoboTwin-MeM,这是一种专门设计用于通过交互式视觉证据评估非马尔可夫操作任务的诊断基准。广泛的评估表明,在 17 项需要内存的模拟任务和 4 项现实世界的双手任务中,EventVLA 的平均成功率比最先进的内存增强 VLA 提高了 40%。