论文

Unit:为人对人的政策学习和世界建模建立统一的物理语言

UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling

摘要

机器人数据的稀缺阻碍了人形基础模型的扩展。虽然大量以自我为中心的人类数据提供了可扩展的替代方案,但由于运动学不匹配,弥合跨实体鸿沟仍然是一个根本挑战。我们引入了 UniT(通过视觉锚定的统一潜在动作分词器),这是一个为人与人之间的传输建立统一物理语言的框架。基于异构运动学共享普遍视觉后果的理念,UnitT 采用了三分支交叉重建机制:动作预测视觉,将运动学锚定到物理结果,而视觉重建动作,以过滤掉不相关的视觉混杂因素。同时,融合分支将这些纯化的模态协同作用到与实施例无关的物理意图的共享离散潜在空间中。我们通过两种范式验证 UnitT:1)策略学习(VLA-UnitT):通过预测这些统一的词元,它有效地利用不同的人类数据,在人形模拟基准和实际部署上实现最先进的数据效率和强大的分布外(OOD)泛化,特别是展示了零样本任务转移。 2)世界建模(WM-UniT):通过统一词元作为条件来调整跨实体动态,实现直接的人与人之间的动作转移。这种对齐确保人类数据无缝转化为人形视频生成的增强动作可控性。最终,通过引入高度一致的跨实体表示(通过 t-SNE 可视化进行经验验证,揭示人类和类人特征融合到共享流形中),UnitT 提供了一条可扩展的路径,将大量人类知识提炼为通用类人功能。