论文
MM-StanceDet:检索增强的多模态多智能体立场检测
MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection
摘要
多模态立场检测(MSD)对理解公共话语至关重要,但有效融合文本与图像——尤其当二者信号冲突时——仍然充满挑战。现有方法常在情境锚定、跨模态解释歧义以及单次推理的脆弱性上遇到困难。为解决这些问题,我们提出检索增强的多模态多智能体立场检测(MM-StanceDet),一个新颖的多智能体框架,集成了用于情境锚定的检索增强、用于细致解读的专用多模态分析智能体、用于探索多种视角的推理增强辩论(Reasoning-Enhanced Debate)阶段,以及用于稳健裁决的自我反思(Self-Reflection)。在五个数据集上的大量实验表明,MM-StanceDet显著优于最先进基线,验证了其多智能体架构和结构化推理阶段在应对复杂多模态立场挑战方面的有效性。