论文
从音频依赖性错误中学习:基于音频问答中模型混淆模式的数据管理策略
Learning from Audio-Dependency Errors: Data Curation Strategies Based on Model Confusion Patterns in Audio Question Answering
摘要
我们将该系统构建为大型音频语言模型的诊断数据管理:在 微调 之前,我们在正常、空音频和混洗音频条件下探测 Qwen3-Omni-30B-A3B-Instruct,以确定当音频证据被删除或不匹配时模型的答案如何变化。这些模型混淆模式用于将训练样本分为文本优先、随机泄漏、强音频依赖以及困难或误导性情况。我们最强大的仅训练系统仅对强音频项目进行微调,其中正常的音频问题对是正确的,但两个反事实变体都失败,加上少量的空音频负数和用于解析失败的生成的纯文本响应规范化器。在官方开发集上,最好的仅训练系统在响应归一化后达到 67.27% 的准确率,而我们当地的 Qwen3-Omni 基线的准确率为 65.90%。最终提交的内容还包括使用训练+开发拆分和三模型集成训练的模型。