论文

ZETA:用于桌面操作的零射击跨实施例 VLA 传输的对照研究

ZETA: A Controlled Study of Zero-Shot Cross-Embodiment VLA Transfer for Tabletop Manipulation

模型评测基准与评测资源

摘要

随着机器人硬件的发展和特定任务数据收集的成本仍然很高,对未见过的实施例的零样本泛化对于可泛化视觉语言动作(VLA)模型非常重要。然而,对这个问题的系统理解仍然有限,部分原因是文献缺乏统一的零样本传输定义和受控评估设置,这些设置将实施例的变化与任务、场景或协议的差异隔离开来。为了解决这个差距,我们首先区分严格的零样本传输(其中所有训练数据中都不存在目标实施例)和预训练暴露的零样本传输(其中目标实施例仅在预训练期间出现)。然后,我们引入了一个涵盖 14 个跨模拟和现实世界验证的目标实施例的受控基准。在此框架内,我们对四个因素进行了受控分析:状态动作表示、预训练体现多样性、辅助协同训练目标和目标体现暴露。实验结果表明,本地末端执行器 (EEF) 状态动作表示、源实施例多样性和辅助协同训练分别将跨实施例迁移提高了约 15、18 和 7 个百分点。我们进一步发现,在预训练期间仅添加 5% 的目标体现数据即可将平均目标体现进度提高 13.4 个百分点,这表明严格和预训练暴露的零样本迁移是不同的,应单独报告。总之,这些发现为评估和改进两指夹持器固定桌面操作中的跨实施例 VLA 传输提供了实用指导,同时激发了未来对更广泛设置(包括移动基础控制、灵巧手和长视野任务)的研究。