论文
MixVLA:非不变信息的自适应混合提升VLA泛化
MixVLA: Adaptive Mixing of Non-Invariant Information for Generalizable Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型在机器人操作上进步显著,但分布外(OOD)条件下的零样本泛化仍有限。这些模型常把任务相关的不变结构与环境特定的非不变因素纠缠,导致策略在动作预测时依赖伪外观线索。我们提出MixVLA——模型无关的训练框架,无需额外OOD数据或架构修改即可改善VLA泛化。其核心是自适应混合非不变信息(AMI):随机混合非不变表示以正则化分布特异的变异性,同时保留互补的预测线索;混合后的非不变特征与不变表示融合用于最终动作预测,在不牺牲策略表现力的前提下提升鲁棒性。在LIBERO、LIBERO-Plus、RoboTwin扰动套件及真实任务等挑战操作设定上的大量实验表明,MixVLA提升总体零样本鲁棒性同时保持强域内性能。