论文
CLASH:言语讽刺检测中词汇和韵律依赖的反事实审计
CLASH: Counterfactual Auditing of Lexical and Prosodic Reliance in Spoken Sarcasm Detection
摘要
言语讽刺检测器可能会利用词汇内容、韵律或它们的相互作用,但传统的评估无法揭示哪些线索驱动了他们的预测。我们引入了 CLASH(受控词汇声学分离Harness),这是一种双语反事实诊断框架,可在原始、词汇保留、韵律保留和近似中性的条件下评估每个话语。我们在 CMMA 和 MUStARD 上评估手工制作的声学特征系统、自监督学习 (SSL) 探针和大型音频语言模型 (LALM)。对于仅目标 Qwen3-Omni,在持续时间平衡后,词汇保留语音比韵律保留语音保留 0.135--0.148 AUROC 优势,且集群引导间隔大于零;替代词汇再合成保留了这一优势。声学干预会改变分数,但不会持续改善评估条件下的辨别力或改变二元预测。语料库中的上下文和交互估计各不相同。这些发现将声音敏感性与讽刺歧视区分开来,同时揭示了持续时间、身份和转换效应。