论文
InstructMove:指令跟随操作的文本不可或缺的基准
InstructMove: A Text-Indispensable Benchmark for Instruction-Following Manipulation
摘要
视觉-语言-动作(VLA)模型通过根据自然语言指令调节机器人动作,使通用机器人操作变得越来越合理。对这种普遍性的一个关键检验是政策是否真正遵循语言指令。然而,许多操纵基准并未确定这种能力:预期目标或目的地通常在视觉上很显着或独特可行,从而使政策能够在不以指令为基础的情况下取得成功。我们认为,遵循指令的评估应该是文本不可或缺的:多个动作应该在视觉和物理上合理,而只有一个动作应该与语言指令一致。我们引入了 InstructMove,这是一个用于指令跟踪操作的文本不可或缺的基准。 InstructMove 在具有语义干扰因素的拾放场景中实例化了这一原理,将指令分解为类别识别、属性辨别、空间推理和组合拾放。 InstructMove 支持带有 InstructMove 训练数据和保留评估任务的训练评估协议,以及针对语言依赖性的附加诊断。对代表性 VLA 策略的实验表明,InstructMove 提供了一个用于诊断视觉快捷方式的受控测试平台,并且 InstructMove 模拟数据可以提高现实世界的指令跟踪操作性能。代码:https://github.com/HorizonRobotics/RoboOrchardSim