论文

EReL@MIR 2025 多模式文档检索挑战赛概述(轨道 1)

Overview of the EReL@MIR 2025 Multimodal Document Retrieval Challenge (Track 1)

模型评测基准与评测资源

摘要

对视觉丰富的文档、文本与图形、表格和图表交错的页面进行检索对于多模式检索增强生成至关重要,但大多数 检索器 仍然放弃视觉通道。 \emph{多模态文档检索挑战}是第一届 EReL@MIR 研讨会上 MIR 挑战赛的 Track~1,与 2025 年网络会议同期举行,要求参与者构建一个 \emph{single} 检索系统,该系统可处理两种互补的机制:从文本查询 (MMDocIR) 中长文档内的闭集文档页面检索,以及从图像或图像加文本查询中对维基百科风格段落的开放域检索(M2KR)。系统根据两个任务的平均 Recall@$\{1,3,5\}$ 的宏观平均值进行排名。该挑战吸引了 22 个团队的 455 名参赛者和 586 份参赛作品。本报告描述了挑战设计、数据集和评估协议;报告最终排名;并对三支获胜球队的体系进行了分析。所有这三个都建立在 Qwen2-VL 系列中基于解码器的 Multimodal-LLM 嵌入器上,而不是 CLIP 式编码器上,主要区别在于它们是否通过微调的集成、具有强大视觉语言重新排序器的 无需训练 多路由融合或零样本后期交互达到顶部。 无需训练 系统的最终成绩与微调获胜者相差 0.1。