论文

Qwen-MusicAVQA-7B:音乐视听 QA 的多模态模型

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

模型训练参数高效训练

摘要

将音频添加到视觉语言模型的常见方法是训练或调整大型全模态系统。我们证明,轻量级替代方案对于音乐视听问答(AVQA)非常有效。 Qwen-MusicAVQA-7B 通过学习的线性投影将冻结的 Whisper 编码器连接到 Qwen2-VL-7B-Instruct。相同的冻结编码器通过单独的投影仪处理视频的音乐曲目和 TTS 语音问题,而语言模型通过预训练的自注意力融合视觉帧、音乐和问题音频,没有特定于任务的融合网络。在 MUSIC-AVQA 上,我们的系统在 7,402 个问题可用视频测试子集上的三个独立训练种子中达到了 96.0% +/- 3.9% 的准确率。我们的主要发现是下游精度跟踪音频表示保留了多少细粒度的局部时间信息。在匹配的 32 个词元比较中,跨步池化 Whisper 帧序列的性能优于扩展到相同预算的全局池化 PANN 表示形式,提高了 26 个百分点,尽管 PANN 至少能看到同样多的音频并使用更大的投影仪。效果不仅仅是序列与矢量的对比:仅在 Whisper 中,以固定的 词元预算 降低时间分辨率的成本相当。在匹配的数据和输入下,微调后的 Qwen2.5-Omni-7B 达到 80.9%,而我们的 30 s 变体为 95.9%;由于系统的主干和适配不同,这是系统级的比较。重新表述的 MUSIC-AVQA-R 基准的采样头和尾分割的准确性仍然很高(96.5% 和 95.6%)。由于两个编码器都保持冻结状态并且音乐功能都被缓存,因此整个适应的训练成本很低:在单个 A100 80GB 上完整的两阶段 AVQA 运行大约需要 5 小时,并且此处报告的每次运行都适合该一个 GPU。