论文

LIBERO-VPro:机器人基础模型的闭环视觉鲁棒性基准测试

LIBERO-VPro: Benchmarking Closed-Loop Visual Robustness of Robotic Foundation Models

智能体系统Agent任务评测

摘要

机器人基础模型在标准操作基准上取得了令人印象深刻的性能,但这些评估通常假设在整个执行过程中进行干净、及时且一致的视觉观察。我们推出了 LIBERO-VPro,这是一个通过扰乱执行过程中可用的视觉证据来系统评估机器人基础模型的闭环视觉鲁棒性的基准。 LIBERO-VPro 涵盖四个互补维度,包括视觉证据退化、相机陈旧、视觉源一致性和任务相关场景变化,涵盖 12 个挑战类别、96 个实验设置和 3,296 个任务条件案例。我们在大约 196,000 个模拟场景中评估了三个视觉-语言-动作模型和三个世界动作模型,并在 Franka Research 3 上进行了 200 个现实世界的展示。我们的结果表明,强大的名义性能可以掩盖视觉基础和适应方面的重大弱点。尽管存在严重的对象级遮挡,模型通常仍然成功,但当局部交互线索被破坏或熟悉的空间先验被违反时,模型会急剧退化。他们对陈旧或缺失的观察结果也高度敏感,并且当任务前提条件发生变化需要行为适应时,他们就会陷入困境。最后,VLA 和 WAM 表现出不同的鲁棒性概况,表明视觉鲁棒性是多维的且依赖于架构。 LIBERO-VPro 提供了一个系统诊断框架,用于开发机器人基础模型,这些模型可以在具有挑战性的视觉条件下更可靠地基础和调整其动作。