论文
MiraBench:评估机器人世界模型的动作条件化可靠性
MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models
摘要
动作条件化世界模型正越来越多地被用作机器人学习的可扩展模拟器,然而现有评估很少提供证据表明其预测在所条件化的动作下是可靠的。现有基准大多强调视觉保真度,导致预测的未来是否物理合理、是否忠实于指令动作、以及在动作本不该成功时是否恰当呈现失败,都不清楚。我们提出MiraBench,一个将动作条件化可靠性(action-conditioned reliability)定义为机器人世界模型核心评估目标的层次化基准。MiraBench将该目标分解为三个要求逐级提高的层次:物理遵循(Physics Adherence),评估免参考的物理一致性;动作跟随保真度(Action-Following Fidelity),衡量预测是否尊重与任务相关的动作输入;乐观偏差检测(Optimism Bias Detection),探究在诱发失败的动作下预测成功结果的倾向。为支撑这一评估,我们整理了一个人工标注语料库,涵盖各任务、失败类别与领先世界模型,包含超过16,000条判定。我们评估了12种代表性模型配置,涵盖向量条件化机器人世界模型、文本条件化生成式世界模型、开源权重系统、闭源系统以及多种模型规模。在这一广泛的模型版图上,MiraBench揭示三个核心发现:视觉保真度是动作保真度的糟糕代理指标;增大模型规模并不能可靠改善动作跟随;乐观偏差在当前系统中普遍存在。通过将评估重心从外观转向动作条件化可靠性,MiraBench为评估和改进作为忠实模拟器的机器人世界模型提供了诊断基础。
