论文

Khondo:孟加拉语表单文档包拆分的多模态基准

Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

模型评测基准与评测资源

摘要

文档包(将多个文档连接成一个文件)在政府和行政工作流程中很常见,但将它们拆分为组成文档很困难,特别是对于资源匮乏的语言而言。我们引入 Khondo(孟加拉语,意为拆分/分段),这是孟加拉国政府表格上文档包拆分的第一个基准。与之前的英语和基于 OCR 文本的数据集不同,Khondo 是双语(孟加拉语 - 英语)和视觉本机的;其中模型直接在页面图像上运行。它涵盖从顺序到完全混排的五种串联方案,跨越 14 个管理域,具有 真值 边界、域类型和页顺序。 MLLM 的零样本评估表明,它们很好地将页面聚类到源文档中,但一旦打乱后很难恢复原始页面顺序。为了找出造成这一困难的原因,我们运行了两次受控分析,改变提示指令,然后改变数据包语言。两者主要影响排序而不是聚类:(a) 明确的页面顺序指令是必要的,但还不够,(b) 英语数据包的排序比孟加拉语更可靠,这使得页面排列成为主要挑战,而语言成为次要但一致的因素。 Khondo 将页面顺序重建确立为基于视觉的低资源文档理解中的一个关键开放问题,并为衡量解决该问题的进展提供了一个受控基准。我们的数据集和代码可在 https://huggingface.co/datasets/Mausul/khondo 获取