论文

InDex:赋予 VLA 模型以意向条件下的臂手协调能力,实现灵巧操作

InDex: Empowering VLA Models with Intent-Conditioned Arm-Hand Coordination for Dexterous Manipulation

模型架构新型架构

摘要

预训练的视觉-语言-动作(VLA)模型提供了有用的语义和空间先验,但它们的并行抓取器动作接口没有指定如何通过灵巧的手来实现这些先验。直接附加手指关节将两个具有不同结构的决策混为一谈:何时应建立接触以及应如何建立特定于形态的手部轨迹。我们引入了 InDex,这是一个意图条件适应框架,可以在不放弃全面监督的情况下分离这些决策。 InDex 从重新定位的演示中得出标准化的掌握意图。第一阶段预测同步的末端执行器——意图块;根据这些预测、VLA 上下文和本体感觉,扩散解码器生成多关节手部动作。因此,标量意图是一个时间协调接口,而不是一个压缩的手部姿势。在四个模拟任务、三个 VLA 主干和一个物理臂-手平台中,InDex 保留了 VLA 的触及能力,同时显着提高了从接近到稳定抓取和任务完成的转换。消融隔离了互补的角色:意图对齐接触转换,而扩散代表与同一任务空间计划兼容的多个手部轨迹。这些结果表明,后伸臂与手的协调,而不是单独的物体定位,是使平行夹具 VLA 适应灵巧操作的主要瓶颈。