论文
AC-VLA:通过组合学习执行鲁棒的分布外动作
AC-VLA: Robust Out-of-Distribution Action Execution via Compositional Learning
摘要
视觉-语言-动作 (VLA) 模型擅长端到端机器人操作,但当熟悉的子任务在不可见的配置中重新组合时,会遇到分布外 (OOD) 泛化的问题。我们确定了两种相辅相成的故障模式:\emph{轨迹过度拟合},其中模型过度拟合整体轨迹模式而不是组合子技能语义;和 \emph{感知捷径},其中动作标记过度依赖手腕视图纹理,而牺牲了全局空间基础。为了解决这两个问题,我们引入了 \textbf{AC-VLA},一个即插即用的动作组合学习框架,包含两个与架构无关的组件: \textbf{(i)} 一个组合学习模块,它使用 LLM 驱动的指令分解器和本体感受轨迹对齐器来生成密集的子任务监督,然后对完整演示和分解数据进行混合训练,赋予模型组合泛化能力;和 \textbf{(ii)} 一种状态条件不对称屏蔽策略,该策略在闭合抓取器阶段抑制手腕视图输入,从而强制执行全局语义基础。所有组件均无需架构修改,可直接集成到任何 VLA 主干中。 AC-VLA 在 $π_{0.5}$ 上实例化并在 LIBERO 和 LIBERO-OOD 基准上进行评估,在组合 OOD 任务上实现了约 28% 的绝对改进,同时保持近乎完美的分布内性能。