论文

InterDyad:通过查询中间视觉引导生成交互式二元语音到视频

InterDyad: Interactive Dyadic Speech-to-Video Generation by Querying Intermediate Visual Guidance

应用与实践内容创作

摘要

尽管语音到视频合成方面取得了进展,但现有方法通常难以捕获跨个体依赖性并提供对二元设置中反应行为的细粒度控制。为了应对这些挑战,我们提出了 InterDyad,这是一个通过查询结构运动指导来实现自然交互式动态合成的框架。具体来说,我们首先设计一个交互注入器,它基于从参考视频中提取的与身份无关的运动先验来实现视频重演。在此基础上,我们引入了一种基于 MetaQuery 的模态对齐机制,以弥合对话音频和这些运动先验之间的差距。通过利用多模态 大语言模型 (MLLM),我们的框架能够从音频中提取语言意图,以指示反应的精确时间和适当性。为了进一步提高极端头部姿势下的口型同步质量,我们提出了角色感知二元高斯指导(RoDG),以增强口型同步和空间一致性。最后,我们引入了一个专用的评估套件,其具有新颖设计的指标来量化二元交互。综合实验表明,InterDyad 在产生自然且基于情境的两人互动方面明显优于最先进的方法。请参阅我们的项目页面以获取演示视频:https://interdyad.github.io/。