论文

GLARE:产生具有适当反应的聆听头

GLARE: Generating Listening Heads with Appropriate Reactions

应用与实践内容创作

摘要

虽然头部说话的一代已经迅速发展,但在二元对话中产生自然的听众行为,即知道何时反应、如何反应以及以何种类型的反应,仍然尚未得到充分探索。现有的二元数据集缺乏细粒度的听众反应注释,并且从说话者和视频生成继承的流行评估指标衡量视觉真实感,而不是听众是否做出适当的反应。我们从三个方面解决这些差距。首先,我们整理了一个基于 RealTalk 和 Seamless Interaction 构建的特定于聆听头部的数据集,其中包含大约 147 小时的配对演讲者-听众视频以及 64,557 个事件级反应注释,涉及六个类别:点头、摇头、微笑、大笑、皱眉和惊讶。其次,我们引入了一个基于流匹配Transformer的音频驱动基线,即 GLARE,具有源自 Qwen2-Audio 的韵律调节和明确监督逐帧反应的时间反应损失。第三,我们提出了一种面向反应的评估协议,联合测量反应发生(R-F1)、时间对齐(R-tIoU)、不对称时间偏差(R-ATD)和反应区域视觉质量(R-FID),提供比仅视觉质量指标更基于行为的评估。实验结果显示,在视觉保真度和反应水平指标方面均优于先前的聆听头方法,这表明反应感知数据、建模和评估对于自然聆听行为至关重要。