论文

BayesianVLA:通过潜在动作查询对视觉语言动作模型进行贝叶斯分解

BayesianVLA: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries

模型训练监督微调与指令调优

摘要

视觉-语言-动作(VLA)模型在机器人操作上显示出前景,但常常难以泛化到新指令或复杂多任务场景。我们识别出当前训练范式的一个关键病灶:目标驱动的数据收集造成数据集偏差。在这类数据集中,语言指令从视觉观察单独即可高度预测,导致指令与动作之间的条件互信息消失,我们把这一现象称为信息坍缩(Information Collapse)。结果,模型退化为忽略语言约束的纯视觉策略,在分布外(OOD)设定中失败。为解决这一问题,我们提出 LangForce,一个通过贝叶斯分解强制指令遵循的新颖框架。通过引入可学习的潜在动作查询,我们构建双分支架构,同时估计纯视觉先验 p(a|v) 与语言条件后验 π(a|v,ℓ)。随后我们优化策略以最大化动作与指令之间的条件逐点互信息(PMI)。该目标有效惩罚视觉捷径,奖励显式解释语言指令的动作。无需新数据,LangForce 显著改善泛化。在 SimplerEnv 与 RoboCasa 上的大量实验显示可观收益,包括在具有挑战性的 OOD SimplerEnv 基准上 11.3% 的提升,验证了该方法把语言稳健接地于动作的能力。

LangForce:经潜在动作查询对视觉-语言-动作模型做贝叶斯分解
图1:RoboCasa( Nasiriany et al., 2024 )中视觉捷径的示例。训练数据呈现出视觉多样性但任务多样性有限。因此,模型学会直接依据特定视觉线索来执行任务,而不是依赖语言指令。