论文

SURE-EVAL:用于可重复评估的系统且统一的 Agentic 框架

SURE-EVAL: A Systematic and Unified Agentic Framework for Reproducible Evaluation

模型评测评测方法与指标

摘要

音频和语音模型发布迅速,但报告的分数通常将模型功能与部署和评估选择混为一谈。相同的检查点可以在不同的运行时、硬件、解码设置或回退策略下产生不同的预测。即使是固定的预测,在不同的归一化和度量实现下也可能获得不同的分数。现有的语音基准标准化了选定的数据集或评分程序,但很少将异构模型加载、受控推理和版本化评分连接到一个可执行工作流程中。我们推出 SURE-EVAL,这是一个系统且统一的 Agentic 框架,用于音频和语音系统的可重复评估。工具Agent工作流程将模型版本转换为隔离的、经过验证的可调用工具。主Agent工作流程提交特定于任务的推理和评分协议,然后将所有评分操作委托给版本化的确定性程序。每个结果都保留其运行时、协议、管道节点、预测和审计工件。在涵盖自动语音识别、文本到语音、语音转换、说话人分类、说话人属性识别和多任务音频理解的 18 个公开版本中,仅限 Codex 的基线一次性完成了 12 个模型,而使用 SURE-EVAL 工具Agent工作流程的同一Agent则完成了所有 18 个模型。我们还对 7 个 ASR 测试条件和两个 TTS 子集进行了统一评估。对三个 TTS 系统的协议分析发现,论文报告的结果和统一结果之间存在 0.02-0.52 分的绝对差异,且方向因模型和语言而异。这些结果表明,可重复的评估需要控制模型执行和输出评分。