论文

RoboTrustBench:对机器人操作视频世界模型的可信度进行基准测试

RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation

模型评测基准与评测资源

摘要

视频世界模型越来越多地用于机器人操作,但现有的基准大多在有效、可行和安全的指令下对其进行评估。我们引入了 RoboTrustBench,这是一个评估视频世界模型在四种场景下可信度的基准:正常、约束敏感、反事实和对抗。 RoboTrustBench 基于现实世界的 DROID 片段构建,包含 1,207 个经过专家验证的指令图像对和具有 13 个细粒度标准的六维评估协议。通过人类和 MLLM 评估来评估七个具有代表性的视频世界模型,我们发现当前的模型通常会生成视觉上连贯的视频,但在约束推理、反事实基础、物理交互和不安全指令抑制方面遇到困难。这些结果表明,视觉质量和表面级指令跟踪不足以建立值得信赖的机器人视频世界建模。