论文

StanceFlip:多模态会话立场翻转预测的综合多维基准

StanceFlip: A Comprehensive Multi-Dimensional Benchmark for Multimodal Conversational Stance Flipping Forecasting

模型评测基准与评测资源

摘要

对话姿态检测已从静态文本分析转向动态多模态建模。然而,现有的基准表现出三个关键的局限性:无法捕捉信念的动态演变,特别是在立场逆转期间;难以将情感状态与逻辑推理分开;并忽视了多模式线索在解决讽刺等语用歧义方面的关键作用。为了解决这些限制,我们提出了 StanceFlip,这是一个为跨五种模式和多场景的多轮对话进行多模态会话立场翻转预测而设计的基准,其中包括两个新颖的子任务:1)多模态立场六元组提取,提取持有者、目标、情感、情绪、立场和理由作为对话的静态快照,以捕获细粒度的认知结构。 2) 动态立场翻转归因,跟踪对话中的立场逆转并识别其潜在触发因素。除了数据集之外,我们还提出了一个名为 ConStaFF 的专用框架,用于多模式对话立场翻转预测(MCSFF)。 ConStaFF 基于 大语言模型 构建,执行端到端立场推理,并集成了立场思考 (ToS) 推理框架和自我反思验证机制,用于结构化立场建模和忠实翻转归因。具体来说,ToS将推理过程分解为专门的认知角色,以制定目标命题、解决跨模态冲突并推断历史立场轨迹。大量实验表明,我们的方法在六元组提取和翻转触发归因方面均实现了最先进的性能,大大优于强大的多模态 大语言模型 基线。