论文
LIBERO-MAX:机器人政策会随着世界的变化而调整吗?
LIBERO-MAX: Do Robot Policies Adapt When the World Changes?
摘要
机器人通常必须在目标移动、视点转移或出现障碍物后继续执行任务,即使它们之前的观察和执行的动作反映了之前的场景。许多仿真鲁棒性基准修复了重置时的外部条件,从而使这一时间挑战未被充分审查。我们推出 LIBERO-MAX,这是一个包含 8,000 个配对案例的基准,涵盖几何、观察、外观、杂波和路径的八种类型的变化。每对比较有和没有中间任务事件的任务执行,保持任务、初始状态、策略种子和事件前操作序列固定。这种受控比较将与事件相关的回归与在没有更改的情况下已经存在的故障区分开来。在当前的 14 项 VLA、混合和世界行动政策中,事件使成功率降低了 11.0-25.7 个百分点。事件概况揭示了几何和观察变化的共同脆弱性,而政策系列排名相互交织。摄像机控制表明,鲁棒性既反映了变化条件下的能力,也反映了变化条件下的轨迹;不同的查询节奏并不能消除差距。配对的协议和时间诊断共同将 LIBERO-MAX 确立为一个可重复的测试平台,用于诊断执行中期变化下的故障,并衡量随着世界变化而保持有效的机器人策略的进展。