论文

SHROOM-Visions 2026:视觉语言模型幻觉检测评测概述

Overview of SHROOM-Visions 2026: A Shared Task on Hallucination Detection in Large Vision-Language Models

模型评测基准与评测资源

摘要

2026 年,我们举办了 SHROOM 共享任务系列的第四次迭代:SHROOM-Visions(视觉语言模型幻觉及相关生成错误共享评测),托管于UncertaiNLP 研讨会与 EMNLP 2026 同期举办。继 2024 年和 2025 年任务的成功之后,这一次我们的目标是通过专注于大型视觉语言模型的模型无关检测任务来解决幻觉。该任务以最近推出的 SHEEP 数据集为基础,旨在跨模型代进行长期评估,邀请参与者在图像条件文本生成(VQA、图像描述等)中检测和分类细粒度的幻觉片段。该评估使用跨越四种语言的五类幻觉分类体系:中文、英语、法语和意大利语。这项共享任务引起了全球 NLP 社区的浓厚兴趣,有 27 个团队贡献了 600 多个系统提交内容。最好的系统在四种语言中的字符级相关性平均得分为 0.58,标签条件相关性平均得分为 0.46,交并比 (IoU) 平均得分为 0.51,比基线高出 30-40 分。