论文

HoloMotion-1 技术报告

HoloMotion-1 Technical Report

模型训练预训练

摘要

在本报告中,我们提出了 HoloMotion-1,一种用于零样本全身运动跟踪的人形运动基础模型。 HoloMotion-1 的一项关键创新是利用大规模混合运动语料库来扩展控制策略训练,其中来自野外视频的视频重建运动提供了运动多样性的主要来源,而精心策划的运动捕捉和内部运动数据则提供了更高保真度的监督和面向部署的覆盖范围。这种数据机制使 HoloMotion-1 能够超越传统的仅 MoCap 训练,并将策略暴露于更广泛的行为、捕获条件和运动风格。从此类异构数据中学习带来了新的挑战,包括重建噪声、源域不匹配、运动质量不均匀以及在大行为变化下需要进行时间建模。为了应对这些挑战,HoloMotion-1 集成了大容量时间建模、稀疏激活的专家混合 Transformer 和用于实时控制的 KV 缓存推理,以及提高扩展运动序列学习效率的序列级训练策略。对多个看不见的运动基准进行的大量实验表明,HoloMotion-1 可以在不同的运动类型和捕获条件下稳健地泛化,与之前的方法相比,显着提高了跟踪精度,并且可以直接转移到真实的人形机器人,而无需特定于任务的 微调。