论文

来自视觉-语言-动作模型的分析概念的显式运动学指导

Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models

模型训练奖励建模与过程监督

摘要

当前的视觉-语言-动作(VLA)模型主要依赖于 2D 输入,忽略了 3D 物理世界中丰富的对象结构信息和常识知识。这一缺陷限制了它们的空间意识和复杂、高精度操作的适应性。为了弥补这一关键差距,我们为 VLA 构建了一个概念专家模块,以构建可执行的分析概念,将对象表示为明确的编程蓝图。我们的机制分两个协同阶段运行:首先,在 VLA 推理之前,概念专家利用视觉基础模型 (VFM) 的 3D 信息来估计初始运动学和结构参数。其次,在整个操纵过程中,VLA模型利用其固有的能力来动态跟踪动态概念参数,不断地将它们与观测变化保持一致,以确保持续的准确性。一旦建立,分析概念将通过 (1) 密集的程序化操作奖励和 (2) 精确的空间指导为 VLA 微调 提供明确、高质量的指导。这种公式允许 VLA 模型学习基于物理的交互行为,同时保持端到端学习的灵活性。我们的实验结果表明,在监督学习和强化学习环境中,成功率和学习效率得到了持续提高,证明了 VLA 后训练 结构化、基于概念的指导的有效性。