论文

AnyAudio-Judge:依据动态评分标准评测音频指令遵循

AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

模型评测基准与评测资源

摘要

指令引导的音频生成需要可靠的对齐评测。现有自动方法通常用通用大语言模型给出整体评分,难以拆解复杂指令、解释结果或捕捉细粒度属性不匹配。研究提出动态评分标准评测,把复杂音频描述自适应拆成若干独立、可验证的二元评分项。AnyAudio-Judge Bench包含7920条精心筛选的双语样本,覆盖语音、声音、音乐与混合音频,并刻意加入困难负例。研究另构建10.5万条带显式思维链推理依据的样本,用于训练专用评判模型AnyAudio-Judge。训练结合监督微调与组相对策略优化,使推理过程与评分标准对齐。实验显示,该模型相对先进基线改善零样本对齐检测,并可提供精确、可解释的奖励信号,改善下游音频生成强化学习中的指令对齐。