论文

HumanNet:将以人为中心的视频学习扩展到一百万小时

HumanNet: Scaling Human-centric Video Learning to One Million Hours

模型评测基准与评测资源

摘要

实体智能的进步越来越依赖于可扩展的数据基础设施。虽然视觉和语言已经随着互联网语料库的扩展而扩展,但学习身体互动仍然受到缺乏大量、多样化且注释丰富的人类活动数据的限制。我们推出了 HumanNet,这是一个时长一百万小时的以人为中心的视频语料库,它捕捉了人类如何与物理世界大规模互动。 HumanNet 涵盖第一人称和第三人称视角,涵盖不同现实世界环境中的细粒度活动、人与物体交互、工具使用和长期行为。除了原始视频之外,该数据集还提供以交互为中心的注释,包括字幕、动作描述以及手部和身体相关信号,从而实现动作感知和交互感知学习。除了规模之外,HumanNet 还引入了用于体现学习的系统数据管理范式,其中以人为中心的过滤、时间结构、观点多样性和注释丰富被视为一流的设计原则。该设计将非结构化互联网视频转变为可扩展的基础,用于表示学习、活动理解、动作生成和人机传输。我们通过受控的视觉-语言-动作消融对该设计的价值进行了第一步验证:在一组固定的验证数据下,使用来自 HumanNet 的 1000 小时的以自我为中心的视频对 Qwen VLM 模型进行持续训练,超过了使用来自 Magic Cobot 的 100 小时的真实机器人数据进行的持续训练,这表明以自我为中心的人类视频可以成为机器人数据的可扩展且经济高效的替代品。通过构建这个项目,我们的目标是探索使用以人为中心的视频来扩展具体基础模型的机会,而不是仅仅依赖于机器人特定的数据。