论文

有意图地行动:为视觉-语言-行动模型提炼行为意图

Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models

摘要

视觉-语言-动作(VLA)模型可以将多模态上下文转化为机器人动作,但其动作解码器仍然主要通过行为克隆进行训练。这监督了所展示的运动命令,同时隐含了指令下的行为所服务的局部目标。基于未来的监督通过框架、潜在观察、轨迹或运动表示丰富了动作学习,但这些信号捕获了可能发生的事情的特定实现,而不是即将发生的行为的共享语义目标。我们提出 Intention 蒸馏 (INDI),它将行为级意图提炼到动作解码器中。在训练期间,冻结的教师 VLM 会解释当前观察、指令、粗略动作摘要和相应执行视频中的演示片段。部署的 VLA 从其标准输入中恢复中间解码器层生成的多模态意图表示,并使用它来组织动作预测以及行为如何展开及其实现的表示。在 SimplerEnv-Bridge 上,INDI 将 GR00T-N1.7 从 64.3% 提高到 84.7%,在 RoboCasa Kitchen 上,它将受控 GR00T-N1.7 基线从 64.1% 提高到 70.3%,在两个基准上都获得了 $π_{0.5}$ 的一致收益。在实际任务中,INDI 将平均成功率从 62.0% 提高到 68.7%,在长期任务上提升高达 12.0 个百分点。进一步的分析表明,解码器使用恢复的潜在变量,捕获行为目标和执行进度,并以依赖于目标的方式组织下游预测。这些结果表明,动作解码器受益于对它们生成的行为的语义目标进行显式建模。