论文

MMAudioReverbs:用于去混响和房间脉冲响应估计的视频引导声学建模

MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation

模型训练监督微调与指令调优

摘要

尽管最近的视频到音频(V2A)模型擅长从视觉输入合成语义上合理的声音,但它们没有明确地模拟房间声学效果,例如混响或房间脉冲响应(RIR),因此对这些效果的可控性有限。然而,我们假设此类 V2A 模型隐含地具有空间音频与相应视觉线索之间关系的语义知识。在本文中,出于上述原因,我们重新审视了 V2A 模型,并提出了利用预训练模型作为符合物理规律的房间声学处理的先验方法。基于最先进的 V2A 模型之一 MMAudio,我们提出了 MMAudioReverbs,它是一个统一的框架,可处理 i) 去混响和 ii) 房间脉冲响应 (RIR) 估计,无需网络架构修改,并在小数据集上进行微调。实验结果表明,根据物理房间声学的类型,音频和视觉提示分别具有优势。这意味着基础 V2A 模型可用于符合物理规律的的室内声学分析。