论文

测试时自适应调节可实现稳定的音频驱动头显生成

Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation

模型推理解码与生成控制

摘要

音频驱动的头部说话的生成在 AniTalker、FLOAT 和 Sonic 等最新模型中取得了显着的进步。尽管取得了成功,但大多数现有方法都依赖于单个静态参考图像来在推理阶段调节整个视频生成过程。这种静态调节范式通常会造成固定身份特征与动态演变的面部运动之间的不匹配,从而导致身份漂移、时间不一致和感知质量下降。我们引入了测试时自适应条件(TT-SAC),这是一种无参数推理框架,使经过预训练的头部说话生成器能够在推理过程中调整其条件表示,而无需重新训练、梯度更新或额外的监督。 TT-SAC 没有将参考肖像视为不可变,而是将生成器及其编码器组合在反馈环路中:生成器自己的输出被重新编码,以构建一个精炼的条件表示,更好地与合成序列的时间动态保持一致。单个适应步骤近似于生成过程的自洽平衡,稳定身份和跨时间的运动。我们进一步提供的理论分析表明,在温和的 Lipschitz 假设下,测试时条件适应减少了特征方差并提高了生成稳定性,同时表现出控制最佳适应强度的原则性偏差-方差权衡。对最先进的头部说话生成器和基准数据集的大量实验表明,口型同步准确性、时间连贯性、身份保留和感知保真度方面得到了持续改进。 TT-SAC 提供了一种与模型无关的 无需训练 策略,用于增强生成视频模型,建立测试时间调节适应作为稳定音频驱动的肖像动画的有效机制。