论文
Colosseum V2:视觉-语言-动作模型的基准泛化
Colosseum V2: Benchmarking Generalization for Vision-Language-Action Models
摘要
在大规模视觉和语言 预训练 进步的推动下,视觉-语言-动作 (VLA) 模型在机器人操作方面展示了有前景的泛化能力。这一进展可能会产生误导。尽管 VLA 具有零样本感知和语言能力,但它们的整体任务性能通常会在分布变化的情况下下降,这揭示了这些系统在将高级理解转化为鲁棒行为方面的差距。为了系统地研究这一差距,我们引入了 Colosseum V2,这是一个大规模模拟基准,用于评估不同条件下机器人学习中 VLA 的泛化能力。该基准测试包括 28 项任务,涵盖 13 个任务类别和两种机器人形态,涵盖广泛的操作原语和长期行为。 Colosseum V2 基于 ManiSkill 模拟器构建,可实现快速、GPU 并行评估,并支持大规模域内和域外测试。我们评估了最先进的方法,包括 Action Chunking Transformer (ACT) 和 Pi0.5,并揭示了基本性能和泛化方面的局限性。我们证明了模拟和现实世界指标之间的紧密相关性,支持了基准的生态有效性。通过在统一基准中标准化任务、指标和评估协议,Colosseum V2 可以实现可重复且公平的比较,减少评估开销,并加速通用机器人策略的进展。