论文
Beyond Monologue:基于会话音频上下文感知核的交互式说听虚拟人生成
Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels
摘要
音频驱动的人体视频生成在独白场景中已取得显著成功,这在很大程度上得益于强大视频生成基础模型的进展。超越独白,真实的人际沟通本质上是一个全双工交互过程,要求虚拟智能体不仅能清晰表达自己的语音,还能自然地对接收到的会话音频做出反应。大多数现有方法只是将传统的音频驱动范式简单扩展到倾听场景。然而,依赖严格的逐帧对齐会使模型对长程会话动态的响应变得僵硬,而直接引入全局注意力则会灾难性地降低唇形同步。认识到说话与倾听行为之间独特的时序尺度差异(Scale Discrepancy),我们引入多头高斯核,将这一物理直觉作为渐进式时序归纳偏置显式注入模型。在此基础上,我们构建了一个全双工交互虚拟智能体,能够同时处理用于说话和倾听的双流音频输入。此外,我们发布了严格清洗的说听数据集VoxHear,其语音与背景音轨完全解耦。大量实验表明,我们的方法成功地将强时序对齐与深层上下文语义相融合,为生成高度自然且响应灵敏的全双工交互数字人树立了新的最先进水平。项目页面见 https://warmcongee.github.io/beyond-monologue/。
