论文
CoInteract:通过空间结构联合生成物理一致的人与物体交互视频合成
CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation
摘要
合成人与物体交互(HOI)视频在电子商务、数字广告和虚拟营销中具有广泛的实用价值。然而,当前的扩散模型尽管具有逼真的渲染能力,但仍然经常在以下方面失败:(i)手和脸等敏感区域的结构稳定性;以及(ii)物理上合理的接触(例如,避免手与物体的相互渗透)。我们提出了 CoInteract,这是一个以人参考图像、产品参考图像、文本提示和语音音频为条件的 HOI 视频合成的端到端框架。 CoInteract 引入了嵌入 Diffusion Transformer (DiT) 主干的两种互补设计。首先,我们提出了一种人类感知专家混合(MoE),通过空间监督路由将词元路由到轻量级、区域专业的专家,以最小的参数开销提高细粒度的结构保真度。其次,我们提出了空间结构化联合生成,这是一种双流训练范例,联合建模 RGB 外观流和辅助 HOI 结构流以注入交互几何先验。在训练期间,HOI 流关注 RGB 词元,其监督规范共享主干权重;在推理时,HOI 分支被删除以实现零开销 RGB 生成。实验结果表明,CoInteract 在结构稳定性、逻辑一致性和交互真实性方面显着优于现有方法。