论文
CAC-VLA:视觉-语言-动作模型的上下文门控动作调节
CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型已成为通用机器人操作的一个有前途的范例,其中视觉语言表示用于调节连续动作的生成。然而,这些表示并未针对动作调节进行明确优化,从而使动作专家能够弥合多模态理解和精确运动控制之间的差距。最近的行动推理方法引入了额外的模块来生成明确的行动计划或行动空间推理信号,展示了行动级指导的好处,但通常需要单独的行动生成框架。我们提出了 CAC-VLA,一种上下文门控动作调节框架,可直接在 VLM 内学习轻量级潜在动作接口。 CAC-VLA 不是生成可执行轨迹,而是训练 VLM 来预测从粗到细的潜在动作,这些潜在动作是从未来动作片段编码的结构化表示,并通过上下文门自适应地利用它们来调节动作专家。这使得 VLM 原生动作调节成为可能,同时校准潜在动作指导对专家动作生成的影响。在 LIBERO、LIBERO-Plus 和 CALVIN 上的实验证明了 CAC-VLA 的有效性,在 LIBERO 和 LIBERO-Plus 上分别实现了 98.9% 和 90.4% 的平均成功率,并且比 CALVIN 上的 π0.5 高出了 9.3 个百分点。