论文

InfBaGel:通过动态感知和迭代细化生成人-物-场景交互

InfBaGel: Human-Object-Scene Interaction Generation with Dynamic Perception and Iterative Refinement

应用与实践内容创作

摘要

人-物-场景交互(HOSI)生成在具体人工智能、模拟和动画领域有着广泛的应用。与人机交互 (HOI) 和人机场景交互 (HSI) 不同,HOSI 生成需要对动态对象场景变化进行推理,但注释数据有限。为了解决这些问题,我们提出了一种从粗到细的指令条件交互生成框架,该框架与一致性模型的迭代去噪过程明确一致。特别是,我们采用动态感知策略,利用先前细化的轨迹来更新场景上下文,并在一致性模型的每个去噪步骤中调节后续细化,从而产生一致的交互。为了进一步减少物理伪影,我们引入了碰撞感知引导,可以减轻采样过程中的碰撞和穿透,而无需细粒度的场景几何形状,从而实现实时生成。为了克服数据稀缺的问题,我们设计了一种混合训练策略,通过将体素化场景占用注入 HOI 数据集来合成伪 HOSI 样本,并与高保真 HSI 数据联合训练,允许交互学习,同时保留真实的场景感知。大量实验表明,我们的方法在 HOSI 和 HOI 生成方面均实现了最先进的性能,并对未见过的场景具有很强的泛化能力。项目页面:https://yudezou.github.io/InfBaGel-page/