论文
低资源语言可以互相学习什么?
What Can Low Resource Languages Learn From Each Other?
摘要
尽管视觉语言模型 (VLM) 取得了快速发展,但它们的语言范围仍然主要局限于高资源语言,使得世界上 7,000 多种现有语言中的大多数都处于日益扩大的数字鸿沟的错误一边。这种差异在光学字符识别 (OCR) 中尤其明显,其中资源匮乏的脚本缺乏传统缩放法则所需的大量数据集。我们研究了极端数据稀缺情况下的 OCR 适应(<10K 真实图像和 <250K 合成图像),证明传统的 微调 策略通常会达到性能上限。我们的主要发现揭示了特定于语言的适应中的结构性低效率:虽然较高层的专用模型会分散以捕获独特的脚本细微差别,但较低层会学习冗余的、高度相似的特征。受这一观察的启发,我们提出了 PSMC(预训练、专业化、合并和协同训练),这是一种利用跨脚本“转移效应”的数据高效框架。我们的方法首先从高资源基础模型中派生出特定于语言的专家,然后采用任务算法将这些专家融合成一个统一的、高性能的多语言骨干。对 10 种印度文字(支持 20 多种语言)的广泛评估表明,在不增加参数数量的情况下,PSMC 的文字识别率 (WRR) 比单个专业模型平均提高了约 2%。我们的结果表明,合并潜在空间中的联合训练促进了有益于所有组成脚本的建设性知识转移,为包容性 VLM 开发提供了可扩展的途径。源代码和数据集将在出版后发布。