论文

HandEdit:以自我为中心的人机灵巧手图像编辑的统一基准

HandEdit: A Unified Benchmark for Egocentric Human-to-Robot Dexterous Hand Image Editing

模型评测基准与评测资源

摘要

用灵巧的双手进行机器人操作是体现人工智能的基石,但其进步却因收集体现感知的远程操作数据的高昂成本而受到抑制。虽然大量以自我为中心的人手视频提供了可扩展的替代方案,但人类和机器人数据之间在外观、清晰度和摄像机视角方面的巨大差异给协同训练带来了重大挑战。尽管现有的通用图像编辑模型表现出强大的功能,但它们缺乏必要的特定于实施例的先验来完全弥合这一差距。在这项工作中,我们提出了 HandEdit,这是一个统一的大规模实体感知图像编辑数据集和基准,专门设计用于将人类的手和手臂转换为自我中心框架内的各种灵巧的机器人实体。 HandEdit 包含来自五个不同源数据集的超过 2 亿个编辑实例,涵盖 26 个不同的 URDF,其中包括 13 个仅手配置和 13 个手臂配置。除了数据集之外,我们还建立了一个统一的基准协议,具有两个轨道:Hand-only 和 Hand-Arm,支持 URDF 条件评估。我们使用多维度量套件对 11 个代表性图像编辑基线进行了广泛的评估,包括通用相似性度量、基于 VLM 的判断和实施例感知度量。 HandEdit 是图像编辑和机器人技术交叉点的关键资源:它推进了体现感知的编辑模型,同时使机器人能够从丰富的人类视频数据中进行可扩展的灵巧学习,为更通用的体现人工智能铺平了道路。