REFACTOR-VLA:类型化运动程序的无监督库学习
REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs
摘要
大多数视觉语言动作(VLA)模型——OpenVLA、$π_0$、RT-2、RDT-1B——都是单一的:它们发出原始运动命令或短动作块,而不将行为组织成可重用的抽象,因此它们在长期任务上性能下降并抵制解释。现有的技能发现方法回避了两个动作序列何时行为等效的核心问题,要么对对比嵌入进行聚类,要么将判断委托给未根据机器人动力学进行校准的语言模型。我们推出了 REFACTOR-VLA,这是一种用于学习可重用技能的唤醒/睡眠系统。它的睡眠阶段将运动程序片段聚集在行为等效内核 (BEK) 下,该内核是通过学习的潜在世界模型 $M_φ$ 的预测轨迹计算得出的;它的唤醒阶段通过 Hindley-Milner 启发的词汇发出类型化的 lambda 术语,并由库条件整流流动作解码器使用。仅当抽象通过最小描述长度和返回保留门时才被允许。我们在 LIBERO 上报告了两项发现。首先,将世界模型从 188M 参数扩大到 430M 会使 4 个套件中的 4 个套件的性能恶化,因此仅靠容量并没有帮助。其次,训练目标更为重要:在世界模型预热期间添加辅助监督对比(InfoNCE)损失可显着改善睡眠阶段聚类,在 $n=3$ 种子处提供标准化互信息,分别为 $0.462 \pm 0.021$(对象)、$0.867 \pm 0.025$(空间)、$0.915 \pm 0.013$(目标)和 $0.754 \pm 0.010$ (LIBERO-10),并且以平均 $Δ= +0.184$ 的成绩击败了所有 4 个套件中最强的已发布基线。跨提供商 ($n=12$),平均成对 NMI 的 95% 引导置信区间为 $[0.683, 0.729]$(平均 $0.705$)。睡眠阶段还产生第一个真正的 LIBERO 任务语言库:解码器使用 3 个公认的抽象中的 2 个,并重写所有 256 个采样演示。