论文
无需训练 使用冻结 VLM 进行以语音为中心的全方位理解
Training-Free Speech-Centric Omni Understanding with Frozen VLMs
摘要
视听理解仍然具有挑战性,因为模型必须共同解释口头内容、视觉事件及其时间关系。现有的全向模型通常引入专用的音频编码器,并依赖于昂贵的音频-视频-文本训练,将全向功能与特定的 VLM 主干紧密耦合,并可能削弱其现有的视觉和推理能力。这就提出了三个问题:原生全向训练对于每个新的 VLM 是否是必要的,是否可以在保留原始骨干的同时添加以语音为中心的全向功能,以及更丰富的声学表示仍然至关重要。我们推出 无需训练 Omni (TFO),这是一种即插即用框架,可将冻结的 VLM 转换为以语音为中心的全向模型,无需进行架构修改或多模式重新调整。 TFO 使用 Whisper 提取经过置信过滤、带时间戳的转录本,并通过 VLM 现有的语言界面路由它们,同时保持其视觉路径不变。在 56 个基准和 21 种语言上与原生全向模型进行匹配比较时,TFO 在视听理解方面具有竞争力,提高了所有五种模型设置的平均纯音频性能,并实现了可观的多语言语音增益。与相应的本机全方位检查点相比,冻结 VLM 通常还可以保留更强的图像/视频理解、视觉基础、编码、数学推理和医学问答。这些结果表明,强大的以语音为中心的全方位理解通常可以通过模块化音频到语言路由来获得,而不是昂贵的骨干特定训练。