论文

Preference-ASR:语音时代 ASR 基准测试的偏好感知测试集 LLM

Preference-ASR: A Preference-Aware Test Set for Benchmarking ASR in the Era of Speech LLMs

模型评测基准与评测资源

摘要

流行的 ASR 测试集对数字、不流畅、实体和大小写采用不一致的约定,而标准规范化器则消除了用户关心的格式区别。因此,当前的基准无法衡量模型是否遵循用户对输出样式的偏好。我们引入了 PreferenceASR,这是一个测试集,用于评估 ASR 系统遵循四个类别的自然语言偏好指令的能力:规范化、实体、不流畅和案例。它由七个开源语料库通过两阶段 LLM 辅助管道和人工验证构建而成,并使用偏好感知规范器进行评估,该规范器有选择地跳过与活动指令匹配的步骤。对四种模型进行基准测试显示,不同偏好类型的排名发生变化,揭示了传统评估所掩盖的质量差异。我们公开发布数据集。