论文

MISID:面向策略欺骗博弈中复杂意图识别的多模态多轮数据集

MISID: A Multimodal Multi-turn Dataset for Complex Intent Recognition in Strategic Deception Games

模型评测基准与评测资源

摘要

理解复杂多轮交互中的人类意图,仍是人机交互与行为分析中的一项根本挑战。现有意图识别数据集主要关注单句或简单对话,而现实场景往往涉及复杂的策略性交互,参与者必须在较长时间内维持复杂的欺骗性叙事。为弥补这一空白,我们提出MISID,一个全面的多模态、多轮、多参与者意图识别基准。MISID源自高风险社交策略游戏,具有细粒度的两层多维标注方案,专为长上下文语篇分析与基于证据的因果追踪而设计。我们在MISID上对最先进多模态大语言模型(MLLM)进行的系统评估揭示了它们在复杂场景中的关键缺陷,包括文本优先的视觉幻觉、跨模态协同受损以及串联因果线索能力有限。因此,我们提出FRACTAM作为基线框架。FRACTAM采用「解耦-锚定-推理」(Decouple-Anchor-Reason)范式,通过提取纯净的单模态事实表征来减少文本偏置,采用两阶段检索实现长程事实锚定,并构建显式的跨模态证据链。大量实验表明,FRACTAM提升了主流模型在复杂策略任务上的表现,改进了隐藏意图检测与推理,同时保持了稳健的感知准确率。数据集发布于 https://naislab.cn/datasets/MISID。

MISID:面向策略欺骗博弈中复杂意图识别的多模态多轮数据集:论文配图
图 1.MISID 基准概述。 (上)展示隐藏策略的多方战略对话时间线。 (下)我们的多维注释方案和基于事实的推理范例,用于推断隐藏的意图。上:多轮交互时间线,参与者采用欺​​骗性策略,例如身份盗窃和虚张声势,以掩盖他们的真实阵营。下:MISID的多维标注方案。它系统地从话语级微观状态(例如情感、主观性)和回合级话语分析(例如模态不一致、关键事件)发展到全面的因果推理链,指导模型从长上下文线索中破译隐藏的意图。