论文
ICDAR2026 多领域文档多模态推理竞赛
ICDAR2026 Competition on Multimodal Reasoning over Documents in Multiple Domains
摘要
在本报告中,我们介绍了 ICDAR2026 多领域文档多模态推理竞赛的结果。本次竞赛旨在通过视觉问答(VQA)任务推进文档理解的研究。本次竞赛以之前的 DocVQA 基准为基础,针对涵盖八个领域的各种文档集合引入了具有挑战性的推理问题,包括商业报告、科学论文、幻灯片、海报、地图、漫画、信息图表和工程图纸。比赛结束时,来自 8 个团队的 20 份有效提交作品涵盖零样本 VLM、OCR 和解析器增强管道、代理检索系统、多代理集成和微调多模态模型。结果表明,最强大的系统超越了单遍提示,而是依赖于跨多个组件的结构化证据提取、检索、验证和编排。