论文

ViHOI:利用视觉先验的人机交互综合

ViHOI: Human-Object Interaction Synthesis with Visual Priors

应用与实践内容创作

摘要

生成逼真且物理上合理的 3D 人机交互 (HOI) 仍然是运动生成中的一个关键挑战。一个主要原因是仅用语言描述这些物理限制是很困难的。为了解决这个限制,我们提出了一种新的范例:从易于访问的 2D 图像中提取丰富的交互先验。具体来说,我们介绍了 ViHOI,这是一种新颖的框架,使基于扩散的生成模型能够利用 2D 图像中丰富的、特定于任务的先验来提高生成质量。我们利用大型视觉语言模型(VLM)作为强大的先验提取引擎,并采用层解耦策略来获取视觉和文本先验。同时,我们设计了一个基于 Q-Former 的适配器,将 VLM 的高维特征压缩为紧凑的先验标记,这极大地促进了扩散模型的条件训练。我们的框架是根据数据集中的运动渲染图像进行训练的,以确保视觉输入和运动序列之间严格的语义对齐。在推理过程中,它利用文本到图像生成模型合成的参考图像来改进对未见过的对象和交互类别的泛化。实验结果表明,ViHOI 实现了最先进的性能,在多个基准测试中优于现有方法,并展示了卓越的泛化能力。