论文

FOCA:面向未来的数据高效视觉-语言-动作适应调节

FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation

模型训练监督微调与指令调优

摘要

视觉-语言-动作(VLA)模型通过大规模多模态预训练实现通用机器人控制,但它们在几次模仿学习下的有效性仍然有限。我们对最先进的 VLA 模型进行了系统的压力测试,结果表明,随着演示的减少,性能急剧下降,揭示了现有适应策略的一个关键弱点。为了解决这个问题,我们引入了 FOCA,一个面向未来的调节框架,用于数据高效的 VLA 适应。 FOCA 将基于任务的未来交互嵌入的显式预测与对未来目标观察的隐式对齐相结合,从而无需像素级预测即可在潜在空间中进行长视野推理。这种公式自然支持与来自视频世界模型的合成视频进行无动作协同训练,并且可以解释为学习未来条件的类似价值的表示。大量实验表明,FOCA 在 LIBERO 上进行了 20 次演示,取得了 95.7% 的成功率,在 RoboCasa 上提高了 7-12%,在真实机器人上实现了高达 26% 的绝对增益,在少数样本 VLA 适应方面建立了新的最先进水平。