论文

ELSA:用于细粒度无参考文本到音频评估的声学事件级语义对齐

ELSA: Acoustic Event-Level Semantic Alignment for Fine-Grained Reference-Free Text-to-Audio Evaluation

模型评测评测方法与指标

摘要

文本转音频 (TTA) 生成(从自然语言合成音频)因其捕获精确用户意图的能力而受到广泛研究。为了有效推进 TTA 模型,必须可靠地评估生成的音频,而无需依赖昂贵的人类主观评分,从而推动与人类判断良好相关的自动评估指标的开发。虽然最近基于 CLAP 的指标提供了实用的无参考解决方案,但它们的粗粒度文本-音频相似性匹配通常与人类评分的相关性较差。为了解决这个问题,我们提出了 ELSA,一种用于细粒度文本音频对齐的无参考评估指标。 ELSA 分解由源自文本查询的不同声学事件引导生成的音频,并评估事件级对齐。四个 TTA 基准的实验表明,与之前的指标相比,ELSA 与人类主观评分的相关性更高,凸显了其可靠 TTA 评估的有效性。