论文
ELAN4D:通过即插即用适配对视觉-语言-动作模型进行以实施例为中心的 4D 监督
ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation
摘要
视觉-语言-动作(VLA)模型已经显示出机器人操纵的前景,但大多数现有策略通过直接从当前观察中回归动作来反应性地运作,而没有明确地模拟未来的动态。这限制了它们在分布外扰动下的泛化能力。为了解决这个问题,我们提出了 ELAN4D,这是一个以实施例为中心的、4D 感知的训练框架,它通过未来的机器人关键点轨迹作为预测时空监督来增强 VLA 策略。仅使用本体感受状态的正向运动学,我们就可以推导出机器人关键点(例如关节和末端执行器)的 3D 位移轨迹,而预处理成本可以忽略不计。这些轨道提供公制和紧凑的监控,无需外部跟踪器或重建。带有轻量级轨道解码器的即插即用辅助分支将此 4D 信号注入动作专家,同时通过梯度隔离保留预训练的视觉语言主干。轨道解码器在推理过程中被丢弃,基本策略接口保持不变。对 LIBERO、LIBERO-Plus、RoboTwin2.0 和实际操作任务的大量实验表明,ELAN4D 在强大的 VLA 基线上持续改进,在分布外扰动(包括相机、背景和布局变化)下实现最佳整体性能和显着收益。这些结果凸显了以实施例为中心的 4D 监督对于构建更强大和更通用的操纵策略的有效性。