论文
QuoVLA:视觉-语言-动作模型的商空间
QuoVLA: Quotient Space for Vision-Language-Action Models
摘要
视觉语言动作 (VLA) 模型通常通过将视觉观察和语言指令映射到连续动作,将预训练的视觉语言模型 (VLM) 应用于机器人控制。现有方法通常采取行动不足的观点,假设预训练的 VLM 潜在对象要么缺乏直接可用的行动信息,要么应该屏蔽行动学习信号。与这种观点相反,我们的 \textit{VLA 商理论}表明,预训练的 VLM 潜在模型不是动作不足,而是动作充足:它们已经包含控制所需的信息,但通过区分诱导相同最佳动作行为的提示级别变化,仍然过于完整。为了具体化这一理论,我们提出了 QuoVLA,一种 VLA 的商空间框架,它将预训练的 VLM 潜在变量压缩为足够动作的表示。具体来说,QuoVLA 通过量化模块和具有相对时间复杂度正则化的双分支设计来实例化这一原理,保留与动作相关的信息,同时消除提示级冗余。跨多个基准的大量实验表明,QuoVLA 实现了强大的性能,尤其是在视觉、语言和环境分布变化下的泛化方面有显着的改进。我们的代码将公开。