论文
JaWildText:日语场景文本理解视觉语言模型的基准
JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding
摘要
日语场景文本带来了多语言基准通常无法捕捉到的挑战,包括混合脚本、频繁的垂直书写以及远大于拉丁字母的字符库存。尽管日语包含在多个多语言基准中,但这些资源并没有充分体现特定于语言的复杂性。与此同时,现有的日本视觉文本数据集主要集中在扫描文档上,而对野外场景文本的探索还不够。为了填补这一空白,我们引入了 JaWildText,这是一个诊断基准,用于评估日语场景文本理解的视觉语言模型 (VLM)。 JaWildText 包含来自日本新捕获的 2,961 张图像的 3,241 个实例,其中包含 112 万个带注释的字符,涵盖 3,643 种独特的字符类型。它包括三个在视觉组织、输出格式和写作风格上有所不同的互补任务:(i)密集场景文本视觉问答(STVQA),它需要对多个视觉文本证据进行推理; (ii) 收据关键信息提取 (KIE),用于测试从移动捕获的收据中进行布局感知的结构化提取; (iii) 手写 OCR,评估跨各种媒体和书写方向的页面级转录。我们评估了 14 个开放权重 VLM,发现最佳模型在这三个任务中的平均得分为 0.64。错误分析表明识别仍然是主要瓶颈,尤其是汉字。 JaWildText 可实现对日语场景文本功能的细粒度、脚本感知诊断,并将与评估代码一起发布。