论文

TimeSteer:联合视听扩散模型中的推理时间语音调度

TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models

模型推理解码与生成控制

摘要

尽管预训练的联合视听扩散模型对要生成的内容提供了丰富的控制,但它们没有对何时发生话语提供明确的控制。为了解决这个问题,我们研究了 \emph{推理时间语音调度},这是一项新颖的任务,它将耦合的语音和视觉清晰度置于用户指定的开始-结束间隔内,而无需微调骨干模型。我们发现了实现此任务的去噪过程的两个内在属性。首先,时间敏感的文本到音频交叉注意力头沿着潜在时间线暴露每个话语的模型隐含源跨度。其次,预测的干净潜伏已经组织了耦合的语音和视觉清晰度,允许编辑它们的时间位置而无需重新生成内容。基于这些发现,我们提出了 \textbf{TimeSteer},一个 无需训练 框架,它通过 \textbf{Source Span Localization} 本地化每个话语的源跨度,并通过 \textbf{Region-Aware Latent Remapping} 将相关的视听潜在内容从源间隔传输到指定的目标间隔。我们进一步引入 \textbf{SpeechShift},这是联合视听生成中间隔级语音调度的第一个基准。跨两个代表性主干网的实验表明,TimeSteer 相对于 无需训练 基线显着提高了间隔可控性,同时保持了具有竞争力的整体生成质量。