论文

声音的缺席:音频语言嵌入难以表达否定

The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

模型评测基准与评测资源

摘要

CLAP等音频语言嵌入模型通常按已有声音事件的匹配能力评测,很少考察否定。论文发现,仅使用肯定描述掩盖了关键缺陷:模型无法有效编码否定声音概念,反而将肯定与否定描述映射到近乎相同的表示。为此,作者提出NegEval-Audio,将已有数据集转换为否定检索Retrieval-Neg和否定多选MCQ-Neg两个任务,检验模型是否区分声音事件的存在与缺席。 在AudioCaps和Clotho上,否定条件下表现明显下降,否定型多选准确率远低于随机水平;近期基于多模态LLM的嵌入模型也存在该问题。无需训练的引导方法能改善MCQ-Neg,却只为Retrieval-Neg带来有限收益。作者将肯定偏差归因于表示几何中的缺陷,指出需要显式加入否定感知训练目标。