论文

RoboGaze:通过结构化视觉语言分析评估机器人世界模型

RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis

模型评测评测方法与指标

摘要

机器人世界模型的最新进展使得合成视频生成能够用于具体预测和规划。然而,评估这些视频具有挑战性:视觉逼真的输出通常违反物理定律、时间一致性或任务逻辑,而传统指标和整体视觉语言模型 (VLM) 判断器无法概括或提供精确的诊断价值。我们推出 RoboGaze,这是一个 无需训练 多代理 VLM 框架,可为生成的机器人操作视频提供结构化、可解释的评估。给定任务说明和视频,RoboGaze 通过三阶段管道进行操作:任务与场景的对应、特定维度的专家路由和基于评审模型的验证。它输出按新颖的 6 维、30 种机器人特定分类法分类的时间局部化的故障报告。为了对 RoboGaze 进行基准测试,我们引入了一个经过人工验证的数据集,其中包含 382 个剪辑,涵盖模拟和现实世界的多视图操作。通过评估 8 个开源和专有的 VLM 主干,RoboGaze 的性能显着优于零样本基线,将描述 F1 提高了 43 点,时间对齐 (F1 x IoU) 提高了 37 点,缩小了与人类上限约 85% 的差距。此外,其批评家验证器减轻了标准 VLM 的“狼来了”误报缺陷,将干净剪辑的准确性从 25% 以下提高到 80% 以上。 RoboGaze 提供了一种可扩展、高度可解释的诊断工具,用于严格评估机器人世界模型。