论文

超越准确性:用于评估大型音频语言模型中的音频推理的 ARIA-Rubrics

Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models

模型评测评测方法与指标

摘要

大音频语言模型在音频推理基准上表现突出,但准确率无法区分真实推理与表面模式匹配,高分也可能来自猜测而非音频理解。评估推理过程对改进能力很重要,但仍有困难。既有方法依赖昂贵人工标注或不透明的语言模型评判,存在实用性、偏差和透明度问题。音频推理还涉及文本场景没有的感知幻觉,以及音频理解与文本推断的跨模态对齐,因此不能直接套用文本评测框架。ARIA-Rubrics是轻量、自动且透明的音频推理完整性评估框架,以六项互补指标检查感知证据对齐、推理连贯性和答案一致性;采用思维链提示使推理过程可观察。九个模型、两项基准的实验识别当前模型的三种推理模式,给出改进方向,并显示与人工判断高度相关。代码在GitHub仓库提供。