论文
Uni-HOI:学习文本和人机交互联合分布的统一框架
Uni-HOI:A Unified framework for Learning the Joint distribution of Text and Human-Object Interaction
摘要
4D 人机交互 (HOI) 建模是计算机视觉领域的一项重大挑战,也是支持虚拟和混合现实应用的一项重要技术。虽然现有的工作在特定的 HOI 任务上取得了有希望的结果,例如文本条件的 HOI 生成和从对象运动生成人体运动,但它们通常依赖于特定于任务的架构,并且缺乏能够处理不同条件输入的统一框架。在此基础上,我们提出了 Uni-HOI,一个学习文本、人体运动和物体运动之间的联合分布的统一框架。通过利用 大语言模型 (LLM) 和两个运动特定的矢量量化变分自动编码器 (VQ-VAE),我们将异构运动数据转换为与 LLM 输入兼容的标记序列,从而实现所有三种模态的无缝集成和联合建模。我们引入了两阶段训练策略:第一阶段在大规模 HOI 数据集上执行多任务学习,以捕获三种模式之间的潜在相关性,而第二阶段在特定任务上微调模型以进一步提高性能。大量实验表明,Uni-HOI 在统一框架内的多个 HOI 相关任务上取得了显着的性能,包括文本驱动的 HOI 生成、物体运动驱动的人体运动生成(可选地带有文本)和人体运动驱动的物体运动预测。