论文

原始子空间介导 VLA 中的少样本传递

Primitive Subspaces Mediate Few-Shot Transfer in VLAs

模型训练监督微调与指令调优

摘要

在工业环境中部署视觉-语言-动作 (VLA) 策略需要能够以低成本教授新任务,这是当前 VLA 所缺乏的属性,因为每个新任务都需要 微调。我们研究原始感知训练是否会产生可转移的工件:一个学习的子技能库,可以在推理时组成,以少量演示为条件,以执行策略从未训练过的任务。我们在匹配的 LoRA 微调 配方和锁定的超参数下,在 REASSEMBLE 接触丰富的组装数据集上训练两种具有不同归纳偏差的 VLA 架构 OpenVLA 和 $π_{0.5}$,在平坦轨迹和具有特定于基元的语言提示的基元分段片段之间进行不同的训练。我们从训练中保留了 6 个对象-任务组合,并评估了小样本迁移:模型接收 $m \in \{0, 1, 3, 5, 10\}$ 保留任务的演示,并尝试在没有权重更新的情况下执行。我们复制三个训练种子并在第二个数据集(LIBERO-Long)上进行验证。原始训练模型只需 m=3 次演示即可达到微调上限性能的 78%,而平面训练模型需要 m=10 次演示才能达到相同水平——在种子、架构和数据集之间复制的 3 倍样本效率差距。为了建立因果关系,我们消除了隐藏状态的原始可解码子空间,并显示少样本传输降低了 32 个百分点,而消除相同维度的随机子空间则没有效果,这表明原始表示是因果上必要的,而不是偶然与传输相关。我们发现并纠正了评估分块策略时的方法论陷阱:单步行动范围门的家庭明智膨胀会产生比 真值 人类演示更高数量级的错误失败率。