论文
GRASP:基于双阶段优化的 CoT 推理,用于多模式讽刺目标识别
GRASP: Grounded CoT Reasoning with Dual-Stage Optimization for Multimodal Sarcasm Target Identification
摘要
超越多模态讽刺检测的传统二元分类范式,多模态讽刺目标识别 (MSTI) 提出了更艰巨的挑战,需要精确定位细粒度目标,例如文本短语和视觉区域。现有方法主要依赖于隐式跨模式对齐,提供有限的可解释性和次优的细粒度定位。为了解决这些限制,我们提出了 GRASP(用于多模态讽刺预测和目标识别的基于双阶段优化的扎根思维链推理),这是一个将视觉基础与显式思维链 (CoT) 推理相结合的框架,以超越黑盒 MSTI。具体来说,我们策划了 MSTI-MAX,这是一个精致的数据集,可以减轻类别不平衡并丰富多模式讽刺线索。我们引入了扎根 CoT 推理,它在推理轨迹中明确锚定与讽刺相关的视觉区域,并促使模型在预测最终分类标签和讽刺目标之前阐明基本原理。此外,我们采用双阶段结果监督联合优化策略:使用坐标感知加权损失监督 微调,然后进行细粒度目标策略优化。大量实验表明,GRASP 在跨模式的细粒度讽刺目标识别方面优于现有基线,并且 LLM-as-a-Judge 评估可定量测量内部推理链的质量。我们的数据集和源代码将在 GitHub 上发布。