论文
MMDS-Bench:对社交媒体交互中的动态立场进行多模式 大语言模型 基准测试
MMDS-Bench: Benchmarking Multimodal Large Language Models on Dynamic Stance in Social Media Interactions
摘要
动态立场分类模拟回复如何响应其直接父消息,而不是帖子如何与固定主题相关。现有的工作主要在纯文本设置中研究这个问题,而社交媒体交互越来越依赖图像、屏幕截图、模因、反应图像和跨模式参考。我们引入了 MMDS-Bench,这是社交媒体家长回复交互中多模式动态立场分类的诊断基准。 MMDS-Bench 包含 3,482 个用七标签动态立场分类法注释的多模式实例,以及需要对父母理解、回复理解和立场关系推理进行结构化推理的 800 个实例诊断子集。我们进一步用五个挑战因素注释每个实例,涵盖多模态融合、父框架、非文字表达、交互推理和标签边界模糊性。我们评估了 12 个闭源和开源多模态 大语言模型,并提出了一个基于参考的 LLM 判断协议,用于评估推理质量。结果表明,当前的 MLLM 仍然难以理解多模态动态立场,特别是在需要超出单独父级和回复理解的关系推理的情况下。