论文
通过受控扰动验证的结构化音频描述的评估框架
An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations
摘要
自动音频描述 (AAC) 的最新进展正在推动从整体句子向结构化格式的转变,这种格式可以解开声学和语义属性,例如不同声音事件的带时间戳的声音描述。这种表示可以支持对创作者进行多方面的声音搜索,并为聋哑人和听力困难的人提供更丰富的听觉信息。然而,目前尚不清楚如何有意义地评估这些混合的、结构化的字幕。我们提出了一个结构化音频描述的评估框架,跨越五个互补轴:标签集、描述、推理、数值测量和频谱轮廓。该框架将语义字段的 大语言模型 (LLM) 判断与时间和声学属性的确定性度量相结合。为了验证这些指标,我们引入了受控扰动,对 真值 注释应用类型化、分级的更改。结果表明,所提出的指标对于保留意义的释义保持稳健,同时响应真正的语义和声学损坏,从而能够更可靠地评估结构化音频描述。