论文
OmniVR:用于档案片段恢复的音频-视频条件生成
OmniVR: Audio-Video Conditional Generation for Archival Footage Restoration
摘要
档案素材通常会遭受视觉和听觉双重退化的影响,但大多数修复系统会分别处理这两种模式。为了解决这个问题,我们提出了OmniVR,这是第一个音视频联合修复的系统框架,涵盖数据构建、模型自适应、高效推理和评估。我们构建了一个带有详细视听描述的高质量音频-视频语料库,并使用联合降级管道来生成对齐的干净和降级对。使用这些对,我们通过引入降级的音频视频条件(TAV2AV)来适应预训练的文本到音频视频模型(T2AV),然后逐步用固定的恢复提示替换示例视听描述,同时保留视听描述/空条件回放。生成的 AV2AV 模型不需要用户提供的文本。在兼容的残差学习模型下,我们证明,相对于相同训练预算下的直接固定提示适应,这种条件退火计划减少了梯度方差和预期恢复风险。为了实现高效部署,OmniVR-Flash 结合了降低分辨率的视频调节、基于 MeanFlow 的单步 蒸馏 和 Turbo VAE,在单个 B200 GPU 上实现了 1K 时约 38 fps 和 2K 时约 18 fps。我们进一步引入 OmniVRBench 来评估四个互补维度:视觉质量、音频质量、时间一致性和视听同步性。 OmniVR 在公共基准测试和 OmniVRBench 上取得了最先进的结果。数据、代码和模型权重将被发布。项目页面:https://xin1u.github.io/OminiVR_PAGE/