论文

DCASE 2026 任务 5 总结:音频相关问答

Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering

模型评测基准与评测资源

摘要

DCASE~2026 Task~5 引入了音频相关问答 (ADQA),它测试大型音频语言模型是否根据音频而不是文本先验进行回答。音频依赖性过滤 (ADF) 管道结合了无声音频探测、每个选项的困惑、大语言模型 (LLM) 常识检查和人工审核,以删除仅可从文本中解决的项目。通过的 3000 个项目构成了 ADQA-Bench 评估集,涵盖音乐、语音和环境音频。首届版本吸引了 14 个团队和 36 个提交项目,横跨两个由总参数计数(最多 100B 和 10B 以下)定义的赛道。中央大学的 MOSS-Audio-8B-Thinking 和 Qwen3-Omni-30B 组合在 \pct{58.33} 处达到了最高的整体精度,而来自同一团队的仅 MOSS 配置在 \pct{57.30} 处领先于 sub-10B 轨道。在具有可比开发分数的 30 份提交中,隐藏评估划分的评估准确度平均下降了 11.91 个百分点 (pp)(中位数 10.91\,pp),隐藏评估划分的设计比开发划分更难。最常见的构建块是:MOSS-Audio-8B-Thinking 主干(36 份提交中的 13 份)、AudioMCQ-StrongAC 上的低秩适应 (LoRA) 微调,以及偏好或强化学习目标 - 五个团队中的组相对策略优化 (GRPO),两个团队中的组奖励解耦标准化策略优化 (GDPO)。在测试时,即时工程几乎是普遍的,多数投票或选择排列投票也很常见。每个系统都会错过同一组 233 个评估项目。