论文
ManipArena:面向推理的多面手机器人操作的综合现实世界评估
ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation
摘要
视觉-语言-动作(VLA)模型和世界动作模型已成为通用机器人智能的中心范式,但由于缺乏物理上真实且诊断控制的评估协议,它们的实证进展仍然受到限制。以模拟器为中心的基准测试提供了规模和可重复性,但无法完全捕捉由感知噪声、接触动态、延迟、校准误差和硬件限制引起的现实差距。相反,真实的机器人评估往往跨平台、场景、对象和评分规则分散,使得公平比较和失败归因变得困难。我们引入了 ManipArena,这是一个标准化的真实机器人评估框架,用于研究匹配物理条件下的操作泛化。 ManipArena 包含 20 项任务、10,812 条专家轨迹、1350 万帧以及大约 188 个机器人小时的桌面和移动操作。该框架结合了模式定义的任务变化、分层域内、视觉转移和语义 OOD 试验、子任务级部分信用评分、三级语言注释、底层运动信号以及从物理场景重建的配对真实到模拟环境。使用 ManipArena,我们评估了涵盖 VLA 和世界动作模型策略的七种桌面配置。结果表明,真实机器人的结论不仅取决于架构,还取决于模型来源、微调 机制、数据采样和注释粒度。因此,ManipArena 为诊断具身泛化中的能力边界和故障模式提供了可重复和可解释的基础。