论文

OmniShow:统一人机交互视频生成的多模态条件

OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation

应用与实践内容创作

摘要

在这项工作中,我们研究了人机交互视频生成(HOIVG),其目的是根据文本、参考图像、音频和姿势合成高质量的人机交互视频。该任务对于电子商务演示、短视频制作和互动娱乐等现实应用中的自动化内容创建具有重要的实用价值。然而,现有方法无法满足所有这些必要条件。我们推出 OmniShow,这是一个专为这项实际但具有挑战性的任务而定制的端到端框架,能够协调多模式条件并提供行业级性能。为了克服可控性和质量之间的权衡,我们引入了统一通道调节以实现高效的图像和姿势注入,并引入门控局部上下文注意以确保精确的视听同步。为了有效解决数据稀缺问题,我们开发了一种解耦然后联合训练策略,该策略利用多阶段训练过程和模型合并来有效利用异构子任务数据集。此外,为了填补该领域的评估空白,我们建立了 HOIVG-Bench,这是一个专门针对 HOIVG 的综合基准测试。大量实验表明,OmniShow 在各种多模式调节设置中实现了最先进的整体性能,为新兴的 HOIVG 任务设定了坚实的标准。