论文
人类视听对话对话生成
Conversational Human Audio-visual Talking Dialogue Generation
摘要
大规模二元交互式视听对话(DIAD)数据集为开发人形交互式虚拟代理和数字人类提供了基础数据资源。然而,收集此类数据既耗时又昂贵,而且在道德上很敏感。为了解决这个问题,我们提出了 CHAT,这是一种新的二元交互式视听对话生成 (DIADG) 框架,可以从单个文本提示生成多样化、成对且相互响应的语音面部对话片段。 CHAT 将 大语言模型 和说话面部模型与交互式音频和面部行为细化模块相结合,从而能够生成具有不同内容和面部身份的对齐二元对话剪辑。实验表明,在客观和主观评估下,CHAT 均优于针对类似任务设计的现有相关方法。此外,我们合成的 CHAT-AVD-50k 数据集可作为下游交互式头生成的有效 预训练 数据,持续改进 REACT 2024 上的 PerFRDiff 和 ReactDiff。CHAT 为昂贵且道德敏感的真实二元交互数据收集提供了可扩展的替代方案。