论文
从抽象到实例化:学习视觉-语言-动作模型的行为表示
From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model
摘要
视觉-语言-动作 (VLA) 模型在分布变化下常常会出现性能下降的问题,因为它们很难学习不同环境中的广义行为表示。虽然现有的方法试图通过以动作为中心的潜在变量构建行为表示,但它们通常受到短时域时间碎片和静态执行对齐的限制,导致复杂场景中行为不一致。为了解决这些限制,我们提出了 \textbf{BehaviorVLA},这是一个通过学习时间连贯的行为表示来促进鲁棒操作的框架。我们的方法具有两个对称组件:(1)\textbf{Visuomotor Behaviour Encoder(VBE)},它利用基于因果 Mamba 的架构将长视野轨迹信息聚合成统一的行为表示; (2)\textbf{相位条件行为解码器(PBD)},它通过动态地将任务级先验与实时执行进度对齐来将这种表示解码为精确的动作。 RoboTwin 2.0、LIBERO 和 CALVIN 上的实验表明,最先进的成功率分别为 58\%、98\% 和 4.36 (Avg.Len)。值得注意的是,在现实世界的模拟到真实传输中,BehaviorVLA 仅使用 50% 的演示数据即可达到 OpenVLA-OFT 的性能,展示了其卓越的数据效率和泛化能力。