论文

超越外观变化:VLA 模型的任务语义动作校准

Beyond Appearance Shifts: Task-Semantic Action Calibration for VLA Models

模型训练监督微调与指令调优

摘要

视觉-语言-动作(VLA)模型在具身操作方面取得了强劲的表现,但仍然缺乏平衡行为稳定性和任务语义敏感性的明确机制。我们确定了两种互补的故障模式。在任务保留变化下,任务语义保持不变,但场景外观发生变化(例如风格、照明、混乱或释义),策略通常会表现出不必要的动作漂移。相反,在语义破坏性变化下,关键任务语义(例如目标对象或约束)发生改变,策略经常无法产生足够不同的行为,而是遵循原始轨迹。为了解决这一差距,我们提出了 BAS-VLA,这是一种建立在冻结基础 VLA 之上的任务语义动作校准框架。 BAS-VLA采用以断裂为中心的校准核心作为默认路径,并引入选择性证据门控保留辅助,仅在检测到干扰变化且任务语义保持一致时才激活。在 OpenPI-pi0.5 / LIBERO-Object Milk-Swap 基准上,BAS-VLA 在干净(98.0%)和语义保留条件(97.5%)上保持很高的成功率,同时在有意的目标-对象交换下将干净标准成功率降低到 0.0%,表现出强大的过时任务抑制和任务语义分离。在经过验证的风格保持转变中,它可以将成功率从 42% 提高到 70%,而不会降低清洁性能。这些结果强调,可靠的 VLA 行为需要超越外观鲁棒性,转向明确的任务语义动作校准。