论文
用于音频相关问答的面向推理的 后训练 和推理时间 LoRA 重新缩放
Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering
摘要
音频相关问答 (ADQA) 需要大型音频语言模型 (LALM) 来回答正确答案取决于给定音频内容的问题。成功的 ADQA 需要准确的音频感知、问题相关证据的识别以及跨模式推理。使用 DCASE 2026 任务 5 的官方 ADQA 数据集,我们研究了 Qwen2.5-Omni 和 MOSS-Audio-8B-Thinking 的具有低秩适应 (LoRA) 的面向推理的 后训练 和推理时间 LoRA 重新缩放。我们引入了一个结构化的思想链(CoT)框架,将推理过程分解为问题分析、问题类型、音频证据和推理。然后,我们分析特定任务的 LoRA 适应如何影响两个骨干网,并进一步探索经过训练的 LoRA 适配器的推理时间重新调整。开发集上的实验揭示了明显依赖主干的行为:后训练 改进了基于 Qwen 的系统,但在我们监督的 微调 配置下显着降低了 MOSS-Audio 的性能。适度的 LoRA 重新缩放进一步将最佳 Qwen 系统的 top-1 精度从 58.93% 提高到 61.05%,并部分恢复了微调后的 MOSS-Audio 模型的性能,而最佳 MOSS-Audio 系统实现了 67.70% 的 top-1 精度。我们提交的系统在挑战赛中在 10B 参数下总体排名第三,在轻量级系统中排名第二。