论文
DocHop:评测信息密集文档中的域外多跳推理
DocHop: Benchmarking Out-of-domain Multi-hop Reasoning in Information-Dense Documents
摘要
多模态大语言模型 (MLLM) 在结构化视觉理解任务(例如图表和文档问答)上取得了出色的性能。然而,现有的基准通常会孤立地评估这些领域,从而导致一个关键功能尚未得到充分开发:模型是否可以使用文本上下文来确定如何选择、解释和聚合图表证据。我们引入了 DocHop,它是文档样式图像中集成图表上下文推理的基准。在DocHop中,文档叙述指定了多步骤组成约束,而图表提供了相应的数据值。问题基于叙述中定义的语义参考标签,要求模型在跨多个图表聚合证据之前从上下文中解析目标实体。为了实现系统评估,我们通过具有可控推理深度和视觉密度的随机逻辑第一代管道构建 DocHop,涵盖六个任务类别的 2,074 个示例。对各种专有和开源 MLLM 的实验表明,与人类的表现存在巨大差距:注释器的准确率达到 90% 以上,而最佳模型仅达到 62.83%。推理增强模型始终显示出改进的结果,但随着推理复杂性的增加,性能会下降。总体而言,DocHop 为具有挑战性的多跳文档推理提供了一个受控测试平台。
