论文

PermVLA:分解阶数作为VLA学习的正则化器

PermVLA: Factorization Order as a Regularizer for VLA Learning

模型训练监督微调与指令调优

摘要

视觉-语言-动作 (VLA) 策略通常通过固定的从左到右 (LTR) 分解来学习动作块,尽管相同的专家轨迹分布允许许多有效的链规则分解。我们将因式分解顺序视为被忽视的正则化选择,并引入因果锚定排列(CAP),它对动作进行采样,揭示具有可调时间顺序前缀的顺序。其辅助目标训练一个共享的策略来预测同一专家块的不同已知子集的操作,同时部署保留确定性的 LTR 控制。我们称之为条件集增强:它从一个专家块创建多个条件预测问题,而无需添加演示。这阻止了对普通教师强制使用的单个时间顺序前缀的依赖。对照实验表明,CAP 在 LIBERO 和 LIBERO-Plus 上始终优于标准 LTR 训练,在跨数据集 CALVIN 评估中也具有相同的优势。测量两个揭示指令下块的联合对数似然之间的预期平方差的诊断验证了 CAP 训练内部化了揭示指令之间的一致性。这些发现将采样的子集条件辅助目标定位为构建VLA正则化器的一般方法,通过扩散动作生成器的扩展来说明。

PermVLA:分解阶数作为VLA学习的正则化器的原论文方法或结果图
图 1:PermVLA概述。自回归VLA训练通常按时间顺序分解每个专家动作块,因此每个操作槽始终是从相同的教师模型强制前缀预测的。 PermVLA将此揭示顺序视为仅训练的自由度:相同的物理动作在多个有效条件子集下受到监督,而专家目标、动作身份和时间顺序自回归部署保持不变。