论文

Jagle:为视觉语言模型构建大规模日语多模态 后训练 数据集

Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models

模型训练合成数据

摘要

开发泛化不同任务的视觉语言模型 (VLM) 需要具有不同内容的大规模训练数据集。在英语中,此类数据集通常是通过聚合和整理大量现有的视觉问答(VQA)资源来构建的。然而,这种策略并不容易扩展到其他语言,因为这些语言的 VQA 数据集在规模和领域覆盖范围上仍然有限。在这项工作中,我们引入了 Jagle,这是迄今为止最大的日本多模式 后训练 数据集,包含跨不同任务的约 920 万个实例。我们不依赖现有的 VQA 数据集,而是收集异构源数据,包括图像、图像文本对和 PDF 文档,并通过基于 VLM 的 QA 生成、翻译和文本渲染等多种策略生成 VQA 对。实验表明,使用 Jagle 训练的 2.2B 模型在 10 个日本评估任务中的平均得分超过了 InternVL3.5-2B,并且与 Qwen3-VL-2B-Instruct 相差不到 5 分。此外,与单独使用 FineVision 进行训练相比,将 Jagle 与 FineVision 相结合可以提高英语表现。这些优势遍及模型主干和规模:LLM-jp-4-VL 9B beta 是一个基于日语中心 LLM-jp-4-8B-instruct 构建的 9B 规模模型,实现了与 Qwen3-VL-8B-Instruct 相当的日语性能。为了促进可重复性和未来的研究,我们发布了数据集、模型和代码。