论文

当模型听到他们期望的内容时:诊断多模态讽刺检测中的韵律启发式

When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection

模型评测模型行为与机制分析

摘要

多模态 大语言模型 (MLLM) 联合处理语音和文本,但它们是利用韵律线索进行语用推理,还是依赖表面声学模式,还没有得到系统的研究。我们通过讽刺检测来解决这个问题,在五种模态条件下评估普通话和英语的 Qwen2.5-Omni 和 Qwen3-Omni,这些模态条件分解了词汇内容、声音语义和韵律结构的贡献。添加音频会系统性地增加误报率,而不会改善真正的检测。声学错误诊断表明,模型错误集中在表达韵律的共同刻板印象上,即升高的音调和不规则的停顿,这与两种语言中标记讽刺的实际线索不同。仅对这两个维度进行有针对性的操纵就可以因果性地证实启发式,导致误报率高达 60%。将相同的操作模板应用于 Gemini~3 Flash Preview 而不进行修改,可以复制效果,这表明该原型超出了 Qwen Omni 系列,而不是源自单一模型架构。