论文

Chitrakshara:印度语言的大型多语言多模态数据集

Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages

模型训练合成数据

摘要

多模态研究主要集中在单图像推理上,对多图像场景的探索有限。最近的模型试图通过对交错图像文本数据集进行大规模预训练来增强多图像理解。然而,大多数视觉语言模型(VLM)主要在英语数据集上进行训练,导致印度语言的代表性不足。为了解决这一差距,我们引入了 Chitrakshara 数据集系列,涵盖源自 Common Crawl 的 11 种印度语言。它包括 (1) Chitrakshara-IL,一个包含 193M 图像、30B 文本标记和 50M 多语言文档的大规模交错预训练数据集,以及 (2) Chitrakshara-Cap,其中包括 44M 图像-文本对和 733M 标记。本文详细介绍了数据收集流程,包括管理、过滤和处理方法。此外,我们还提供了全面的质量和多样性分析,以评估数据集在印度语言中的代表性及其开发更具文化包容性的 VLM 的潜力。