论文

H2R-Bench:世界模型中人机操作视频生成的基准测试

H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models

模型评测基准与评测资源

摘要

大规模操作数据对于机器人学习至关重要,但收集机器人演示仍然昂贵且难以扩展。与此同时,大量以自我为中心的人类操作视频提供了丰富的行为体验,但由于人手和机器人末端执行器之间的差异,将它们跨实施例转移仍然具有挑战性。视频世界模型的最新进展为根据人类观察合成以机器人为中心的操作视频提供了一条有前途的途径,而它们的跨实体传输能力在很大程度上仍未得到探索。因此,我们引入了 H2R-Bench,一个用于评估跨实施例人机操作视频生成的基准,其中模型将以自我为中心的人类演示转换为指定实施例下的机器人操作视频。每个基准实例都包含人类演示视频、目标实施例约束以及涵盖任务目标、动作事件、功能接触和对象响应的基于源的注释。 H2R-Bench 通过五个维度评估生成的视频,包括目标状态完成度、动作事件完成度、功能性接触转移、体现正确性和一般视频质量。我们对六个操纵系列和两个机器人实施例中的十一个最先进的视频生成模型进行了基准测试。我们的评估表明,当前的视频世界模型在人机交互操作方面仍然受到限制:即使是领先的模型也常常在体现一致性、功能交互和任务执行方面失败。 H2R-Bench 提供了一个系统的诊断框架,用于评估视频世界模型是否可以弥合人与机器人的具体差距,并将人类操作观察结果转化为以机器人为中心的训练资源。