论文
ShredBench:评估多模态 LLM 在文档重建中的语义推理能力
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
摘要
多模态 大语言模型 (MLLM) 在视觉丰富文档理解 (VRDU) 任务中取得了显着的性能,但它们的能力主要在原始、结构良好的文档图像上进行评估。我们考虑从碎片中恢复内容,这是一种具有挑战性的 VRDU 设置,需要在内容显着不连续的情况下将视觉模式识别与语义推理相结合。为了促进对复杂 VRDU 任务的系统评估,我们引入了 ShredBench,这是一个由自动生成管道支持的基准测试,可直接从 Markdown 渲染碎片文档。所提出的管道通过允许灵活集成最新或未见过的文本源来确保评估的有效性,以防止训练数据污染。 ShredBench 以三种碎片粒度(8、12、16 块)评估四种场景(英语、中文、代码、表格)。对最先进的 MLLM 的实证评估揭示了显着的性能差距:该方法对完整文档有效;然而,一旦文件被粉碎,恢复就成为一个重大挑战,随着碎片的增加,NED 急剧下降。我们的研究结果强调,当前的 MLLM 缺乏弥合视觉不连续性所需的细粒度跨模式推理,从而确定了稳健的 VRDU 研究中的关键差距。