注意力记忆:具有视觉-语言-运动图的语言条件重感知
Memory for Attention: Language-Conditioned Re-Perception with a Vision--Language--Motion Map
摘要
携带持久的、行为注释的地图的机器人面临两个截然不同的规划问题,而它的记忆只能很好地回答其中一个问题。空间导航问题——如何在房间里走动——我们首先解决,并报告了一个负面的问题:在视觉语言运动地图 (VLMM) 的基础上,行为感知规划器成本在 28 个 AI2-THOR 场景中将规划时间目标减少了约 35%,但在闭环执行下,这种好处几乎消失了 (约 4%),按需视觉语言模型 (VLM) 也是如此。资源分配问题是不同的:在有限的感知预算下,机器人现在应该注意什么才能保持自己的地图新鲜?将重新感知作为这种注意决策,我们展示了持久地图的记忆 - 变化历史,甚至只是最后一次看到的新近度 - 产生了我们测试(保留)的最佳重新感知时间表,而无记忆类别先验是在 sqrt-law 时间表下最弱的 - 尽管在 Whittle 指数下它领先于记忆,直到异质性成为现实。正如柯西-施瓦茨界限预测的那样,增益随着每个实例的异质性而增长,跟踪 Var(sqrt(lambda))、根波动率的方差,并将预算重新分配给计划保护的重要对象;与真实的 CLIP 可移动性先验相比,它是 +21-26%,其中大约一半在先验的饱和规模校准后存活下来 (+7-13%)。当任务以语言为条件时,地图的完整组合就发挥了作用:告诉要跟踪什么,VLMM 接地相关对象(开放词汇)并跟踪它们的变化(记忆),击败相关性加权新近度基线(在完全异质性下,超过 26 个查询+2.9%;当实例率跟踪类别规范时,顺序会反转) - 以及先验类别(+9.2%)。地图的作用不是告诉机器人如何在房间里走动,而是告诉它要注意什么。