论文

IntentVLA:别名机器人操作的短视野意图建模

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

摘要

机器人模仿数据通常是多模态的:相似的视觉语言观察可能会跟随不同的动作块,因为人类演示者的行为具有不同的短期意图、任务阶段或最近的上下文。现有的帧条件 VLA 策略仅根据当前观察和指令推断每个块,因此在部分可观察性下,它们可能会在相邻的重新规划步骤中重新采样不同的意图,从而导致块间冲突和不稳定的执行。我们引入了 IntentVLA,这是一个历史条件 VLA 框架,它将最近的视觉观察编码为紧凑的短视野意图表示,并使用它来条件块生成。我们进一步介绍了 AliasBench,这是一个基于 RoboTwin2 的 12 任务模糊感知基准测试,具有匹配的训练数据和评估环境,可隔离短视野观察混叠。在 AliasBench、SimplerEnv、LIBERO 和 RoboCasa 中,IntentVLA 提高了采样轨迹稳定性并优于强大的 VLA 基线