论文
MISID:面向策略欺骗博弈中复杂意图识别的多模态多轮数据集
MISID: A Multimodal Multi-turn Dataset for Complex Intent Recognition in Strategic Deception Games
摘要
理解复杂多轮交互中的人类意图,仍是人机交互与行为分析中的一项根本挑战。现有意图识别数据集主要关注单句或简单对话,而现实场景往往涉及复杂的策略性交互,参与者必须在较长时间内维持复杂的欺骗性叙事。为弥补这一空白,我们提出MISID,一个全面的多模态、多轮、多参与者意图识别基准。MISID源自高风险社交策略游戏,具有细粒度的两层多维标注方案,专为长上下文语篇分析与基于证据的因果追踪而设计。我们在MISID上对最先进多模态大语言模型(MLLM)进行的系统评估揭示了它们在复杂场景中的关键缺陷,包括文本优先的视觉幻觉、跨模态协同受损以及串联因果线索能力有限。因此,我们提出FRACTAM作为基线框架。FRACTAM采用「解耦-锚定-推理」(Decouple-Anchor-Reason)范式,通过提取纯净的单模态事实表征来减少文本偏置,采用两阶段检索实现长程事实锚定,并构建显式的跨模态证据链。大量实验表明,FRACTAM提升了主流模型在复杂策略任务上的表现,改进了隐藏意图检测与推理,同时保持了稳健的感知准确率。数据集发布于 https://naislab.cn/datasets/MISID。
