论文
RoboChrono:流式任务理解的真实机器人基准
RoboChrono: A Real Robot Benchmark for Streaming Task Understanding
摘要
了解正在进行的机器人操作需要模型来解释与交互历史和任务进度相关的视觉观察。我们推出了 RoboChrono,这是流式任务理解的基准,包含 39 个场景和 34,713 个评估实例,由真实的机器人执行和补充的徒手人类记录构建而成。该基准评估了七项任务,分为识别、对齐和时间基础,涵盖动作理解和预期、视觉对应、时间排序和动作定位。对 18 种视觉语言模型的零样本评估揭示了任务之间的显着差异。 GPT-6-Astra 在帧匹配上的准确率达到 98.3%,在帧排序上的准确率达到 68.3%,而 RynnBrain1.1-122B-A10B 的差距更大,分别达到 95.4% 和 32.9%。使用五个开放权重模型对匹配问题进行输入消融,进一步揭示了对视觉证据的明显依赖性:删除视觉观察会使当前动作识别准确度降低 22.1 个百分点,而下一步动作预测仅降低 0.7 个百分点。这些发现表明,强视觉匹配并不总是与强时间顺序一致,并且表明即使在视觉证据不可用的情况下,任务和动作先验也可以支持下一步动作预测。 RoboChrono 提供了一个诊断设置来检查这些差异,强调在评估机器人操作中的任务理解时,除了总分之外还需要进行特定于能力的评估。