论文
PalmLeaf-VQA:评测多模态模型对贝叶手稿的理解
PalmLeaf-VQA: A Multi-Script Visual Question Answering Benchmark for Historical Palm-Leaf Manuscript Understanding Across Diverse Regions
摘要
历史手稿在现代视觉语言基准中仍很少出现,因此多模态LLM如何处理文化多样、退化以及非拉丁文字的文档图像,仍有待研究。我们提出PalmLeaf-VQA,一个涵盖南亚与东南亚传统、面向历史贝叶手稿理解的多文字体系视觉问答基准。基准包含来自八个收藏组的923张精选手稿图像和7384组问答,八组为巴厘、Grantha、Jathakam、Kambaramayanam、卡纳达、Khmer、Sundanese和泰米尔。不同于以识别为导向的资源,它针对与保存相关线索的手稿视觉推理,包括物理状态、行结构、材料与涂层、装订孔、边缘、符号、绘图和局部视觉瑕疵。我们以开放答案和受约束答案提示评估近期专有与开放权重MLLM,并按收藏、问题类别和任务类型进行细粒度分析。最强受测模型在留出测试集上仅达到58.00%的精确匹配准确率,揭示当前MLLM在稀有文字、退化版式和保存导向文档理解中的明显局限。PalmLeaf-VQA为推进文化语境与版式感知的多模态文档分析提供标准化基准。