论文

CHARM:基于 LLM 的多模态讽刺检测的电荷校准和声学救援

CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection

模型推理推理验证与自校正

摘要

讽刺检测,即识别字面意义和预期含义之间的差异,是情感计算中的一项基本任务。然而,零样本指令调整的 大语言模型 (LLM) 系统性地过度预测了整个能力范围内的积极(讽刺)类别,而人类所依赖的韵律线索仍未得到充分利用,并且在不同语言之间的转移不均匀。我们介绍 CHARM(用于多模态讽刺检测的电荷校准和声学救援),这是一个耦合两个模块的 无需训练 框架。双向充电校准 (BiCAL) 引导 LLM 沿着充电提示的对称轴做出相反的讽刺和字面判断;引起的方向偏差可以通过构造消除,并且简单的聚合可以恢复无偏差的实用信号。然后,声学后期融合救援 (ALFR) 通过浅层分类器将校准后的投票与韵律描述符和 LLM 生成的听觉感知探针融合在一起,主动降低饱和文本投票的权重,以支持声学证据。在没有 微调 任何主干的情况下,BiCAL 在 MUStARD 上获得了最高报告的零样本纯文本 Macro-F1 0.787,而 ALFR 在 CMMA 上将较弱的主干提升了高达 +0.382 Macro-F1。 Stouffer 荟萃分析证实了 MUStARD 和 CMMA 的统计显着性(分别为 Z = 13.89 和 Z = 34.64;p < 10^-43)。我们的分析进一步揭示了跨文化韵律解耦:低层声学特征无法跨语言转移,而高级感知抽象仍然强大。这些组件共同产生了一个可解释的、跨语言的多模态检测器。