论文

AnySlot:用于零样本插槽级布局的目标条件视觉语言操作策略

AnySlot: Goal-Conditioned Vision-Language-Action Policies for Zero-Shot Slot-Level Placement

摘要

视觉-语言-动作(VLA)策略已经成为通用机器人操作的通用范例。然而,组合语言下的精确对象放置对于端到端 VLA 策略仍然具有挑战性。槽位级布局需要可靠的槽位定位和厘米级的几何精度。为此,我们提出了 AnySlot,这是一个通过在语言基础和控制之间引入明确的空间视觉目标来降低构图复杂性的框架。 AnySlot 通过在预期槽位渲染空间标记将语言转换为视觉目标,然后使用目标条件 VLA 策略执行该目标。这种分层设计将高级槽选择与底层执行解耦,提高了语义准确性和空间鲁棒性。此外,认识到缺乏此类精度要求高的任务的基准,我们引入了 SlotBench,这是一种结构化模拟基准,具有九个任务类别,用于评估插槽级布局中的空间推理。大量实验表明,AnySlot 在零样本插槽级布局方面明显优于平坦 VLA 基线和模块化定位方法。