论文
AudioProcessBench:识别基于音频的推理中的过程错误的基准
AudioProcessBench: Benchmark for Identifying Process Errors in Audio-Grounded Reasoning
摘要
大型音频语言模型(LALM)越来越多地使用显式推理轨迹来进行复杂的音频理解,但推理质量的评估仍未得到充分探索。尽管过程奖励模型(PRM)的过程级基准在文本和多模态领域具有先进的推理评估,但音频推理的可比评估仍然有限。在本文中,我们提出了 AudioProcessBench,这是音频推理中步骤级过程错误识别的综合基准。 AudioProcessBench 包含由 6 个音频和全语言模型生成的各种推理轨迹。每个跟踪都被分割为离散推理步骤,并用二进制步骤正确性和细粒度错误类型进行注释。我们的基准测试在三个互补范例下评估模型:(1)步骤正确性识别,(2)用于诊断音频特定验证者能力的错误类型条件检测,以及(3)链级聚合,其中验证者在同一问题的多个推理轨迹中进行选择或聚合。这种设计可以系统地分析当前模型是否可以检测过程错误、它们的弱点是否因音频特定错误类型而异,以及过程验证是否可以转化为改进的答案选择。 AudioProcessBench 为音频推理验证器、过程奖励模型和可靠的全模态推理的未来研究提供了一个测试平台。