论文

MLLM 真的了解资源匮乏的高棉文献吗?高棉文献VQA试点研究

Do MLLMs Really Understand Low-Resource Khmer Documents? A Pilot Study on Khmer Document VQA

模型评测模型能力评测

摘要

最近的多模式 大语言模型 (MLLM) 具有高级文档理解、可视化问答和文本提取功能。然而,它们在资源匮乏、非拉丁语环境中的可靠性仍然不确定。高棉语形式的文档面临着特殊的挑战,因为它们包含复杂的文字形式、混合的高棉英语字段以及柬埔寨瑞尔和美元的货币价值。高棉文件 VQA 的可用资源也很有限。本文提出了对高棉文档图像的开放 MLLM 的试点诊断评估。我们从之前引入的 KH-FUNSD 集合中构建了一个评估子集,涵盖发票、收据、报价单和其他业务表单。该子集包括英语和高棉语问题,答案保留其原始英语、高棉语、混合文字或数字形式。这项研究并没有引入完整的公共基准,而是检查了现有模型的功能和故障模式。我们使用基于图像的直接提示来评估代表性的开放 Qwen-VL 模型,并将解析器辅助和外部 OCR 辅助配置与 Qwen3-VL-8B 进行比较。 Direct Qwen3-VL-8B 的性能优于较小的模型,总体准确率达到 51.9%,但对于高棉语脚本和混合脚本答案的性能仍然有限。外部 OCR 产生最强的结果,Tesseract 达到 61.9%,PaddleOCR 达到 61.6%。尽管如此,高棉语文字的答案仍然比英语和数字字段困难得多。结果表明,当前的 MLLM 可以处理视觉上清晰的英语和结构化数字内容,但可靠的本地高棉语文档理解仍然是一个开放的挑战。