论文

RoboProcessBench:视觉语言机器人操作中流程感知理解的基准测试

RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation

模型评测基准与评测资源

摘要

视觉语言模型(VLM)越来越多地被探索作为机器人操作中的视觉批评者、奖励生成器和故障检测器。这些角色隐含地要求模型不仅要判断最终任务是否成功,还要判断操作执行在物理上和时间上的进展情况。然而,现有的评估无法测试 VLM 是否具有细粒度的流程理解。为了解决这一差距,我们提出了 RoboProcessBench,这是视觉语言机器人操作过程感知理解的基准。 RoboProcessBench 将这种能力分解为两个互补的维度,\emph{静态监控} 和 \emph{动态推理},实例化为 12 个诊断问题族,涵盖阶段、接触、运动、协调、原始局部进展、时间顺序、结果和原始级别转换。精心策划的基准语料库 ProcessData 由物理基础的执行跟踪构建而成,包含跨 260 个操作任务的 58k 个问答对,并进一步分为 ProcessData-SFT 和 ProcessData-Eval 以用于 后训练 和评估目的。对 ProcessData-Eval 上各种 VLM 的广泛评估揭示了 12 个诊断任务系列的广泛局限性,表明当前模型仍然缺乏对操作执行的强大的流程感知理解。但使用 ProcessData-SFT,经过训练的 \textit{Qwen2.5-VL-7B} 和 \textit{InternVL-3-8B} 在局部状态、运动、进度和基元感知线索方面表现出一致的增益。这些结果表明,RoboProcessBench 既可作为评估基准,又可作为可学习的监督源,用于开发能够监控和评估机器人操作过程的 VLM。项目网页:\href{https://processbench-2026.github.io/RoboProcessBench-Web/}{https://processbench-2026.github.io}。