论文

视觉-语言-行动的连续推理

Continuous Reasoning for Vision-Language-Action

模型推理推理策略与问题分解

摘要

自然语言是语言和视觉语言模型的强大推理媒介,但它与连续控制的粒度不匹配。文本和显式子目标在任务级粒度上运行,而视觉语言动作(VLA)策略必须在更精细的时间尺度上选择动作;因此,单个推理步骤可以跨越许多动作块,同时仅与现在所需的动作保持弱耦合。这向 VLA 提出了一个不同的问题:语言应该扮演什么角色?我们认为,有用的 VLA 推理媒介必须可在模型实例之间共享,可通过下游操作改进进行验证,并与时间扩展的控制结构保持一致。基于这个观点,我们提出了视觉-语言-行动的连续推理。我们的模型首先以一组结构化的连续思维的形式预测连续推理,然后将它们重新用作块结构动作生成的共享上下文。更好的动作预测本身并不能证明良好的推理:如果相同的内部介质无法在模型实例之间共享,并通过改进的下游控制进行独立验证,则添加的潜在可能只是成为模型私有的捷径,有助于看到的行为而不支持可概括的控制。因此,我们将连续推理实例化为共享高斯潜在接口,并使用自我验证目标对其进行训练,其中指数移动平均教师在预测目标动作时必须成功地消耗学生的推理。根据经验,连续推理提高了 LIBERO-PRO 的鲁棒性,并在真实机器人上表现强劲,在 TX-G2(AgiBot G2 兼容变体)上将平均子任务成功率提高 40.4%,在 π0.5 上提高 40.4%,在 HSR 上提高 26.3%。这表明 VLA 中的推理与其说是关于额外的标记,不如说是关于可共享、可验证的内部操作语言。