论文

MINT-Bench:用于指令跟踪文本转语音的综合多语言基准

MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech

模型评测基准与评测资源

摘要

指令跟随文本转语音 (TTS) 已成为可控和富有表现力的语音生成的重要能力,但由于基准覆盖范围有限、诊断粒度较弱和多语言支持不足,其评估仍然不发达。我们推出 \textbf{MINT-Bench},这是一个用于指令跟踪 TTS 的综合多语言基准测试。 MINT-Bench 建立在分层多轴分类法、可扩展的多阶段数据构建管道以及分层混合评估协议的基础上,该协议共同评估内容一致性、指令遵循和感知质量。跨十种语言的实验表明,当前系统仍远未解决:前沿商业系统总体领先,而领先的开源模型变得极具竞争力,甚至在中文等本地化环境中可以超越商业同行。该基准进一步表明,更难的构图和副语言控制仍然是当前系统的主要瓶颈。我们发布 MINT-Bench 以及数据构建和评估工具包,以支持未来可控、多语言、基于诊断的 TTS 评估研究。排行榜和演示可在 https://aslp-lab.github.io/MINT-Bench-Demo/ 获取