论文

AURA:恒定VRAM的机器人策略动作门控记忆

AURA: Action-Gated Memory for Robot Policies at Constant VRAM

模型推理KV Cache

摘要

KV 缓存对于数据中心来说是正确的内存,但对于机器人来说却是错误的内存。数据中心推理会批量处理许多短请求并重置它们,从而在人群中分摊注意力缓存。相反,具体代理在带宽有限的边缘硬件上运行一个漫长的、非重置的事件,其中高带宽内存和闪存稀缺,闪存的写入耐久性有限,并且内存写入而不是计算可能成为绑定约束。 AURA-Mem(动作实用程序循环自适应记忆)针对的是这种机制。它将冻结的视觉-语言-动作主干与恒定大小的循环记忆和学习门包裹在一起,学习门仅在当前观察将改变下一个动作时才写入:知道何时保持沉默的记忆。与基于重建的记忆不同,门是直接针对闭环动作错误信号进行训练的。无论范围如何,其推理状态都固定为 4,224 字节,而 KV 缓存以 100,000 步增长到 6,061 倍。在受控综合基准上,AURA-Mem 在准确性方面与最佳 O(1) 基线相匹配,同时写入次数减少了 5.19-6.13 倍,在更简单的配置上写入次数减少了 9.19 倍。预算匹配的随机和定期计划无法恢复这种增益,从而隔离了行动惊喜信号的好处。在 LIBERO-Long 上经过训练的闭环 OpenVLA-OFT 7B 面板上(每臂 n=60 次),门控不会影响成功:AURA-Mem 与非门控基本策略 (0.233) 匹配,并略高于始终写入 KV 臂 (0.217),同时使用少 7.0 倍的写入和恒定内存。我们还实例化了近似信息状态价值损失界限作为方法演示;在这种规模下,界限是空洞的,而不是保证。