论文

DocHop:评测信息密集文档中的域外多跳推理

DocHop: Benchmarking Out-of-domain Multi-hop Reasoning in Information-Dense Documents

模型评测基准与评测资源

摘要

多模态大语言模型 (MLLM) 在结构化视觉理解任务(例如图表和文档问答)上取得了出色的性能。然而,现有的基准通常会孤立地评估这些领域,从而导致一个关键功能尚未得到充分开发:模型是否可以使用文本上下文来确定如何选择、解释和聚合图表证据。我们引入了 DocHop,它是文档样式图像中集成图表上下文推理的基准。在DocHop中,文档叙述指定了多步骤组成约束,而图表提供了相应的数据值。问题基于叙述中定义的语义参考标签,要求模型在跨多个图表聚合证据之前从上下文中解析目标实体。为了实现系统评估,我们通过具有可控推理深度和视觉密度的随机逻辑第一代管道构建 DocHop,涵盖六个任务类别的 2,074 个示例。对各种专有和开源 MLLM 的实验表明,与人类的表现存在巨大差距:注释器的准确率达到 90% 以上,而最佳模型仅达到 62.83%。推理增强模型始终显示出改进的结果,但随着推理复杂性的增加,性能会下降。总体而言,DocHop 为具有挑战性的多跳文档推理提供了一个受控测试平台。

DocHop:评测信息密集文档中的域外多跳推理:论文配图
图1: DocHop的例子。每个文件实例都对应一个随机抽样的多跳推理跟踪,该跟踪转换成叙述性上下文,与多个图表交错。说明具体说明了追踪的构成限制,最后为执行时暗示的实体指定了一个语义参考标签。然后根据这个标签而不是明确的实体名称提出问题,要求模型从文件上下文中解决目标,并从图表中得出综合数字证据。彩色箭头显示文档中的限制内容;黑箭头显示模式需要查看的具体图表,以检查输入实体是否满足了限制。