论文
看到看不见的东西:像素语言模型适应的视觉相似性
Seeing the Unseen: Visual Similarity for Pixel Language Model Adaptation
摘要
基于像素的语言模型(LM)通过处理文本的渲染图像来取代传统的分词器,使得跨语言传输严重依赖于书写系统的视觉和结构特性。然而,使这些模型适应形态复杂、以独特文字书写的低资源语言的动态尚未得到探索。以藏文为案例研究,我们分析了基于像素的 LM 的持续 预训练 如何受到数据规模、初始脚本暴露以及其他婆罗米文语言的跨语言迁移的影响。我们引入了四个渲染级别指标来量化视觉脚本相似性。我们评估三项任务的下游绩效。我们的结果表明,即使在严格的数据限制下,较高的字法接近度也能增强语义转移。此外,我们发现基于 预训练 起点的性能不对称:虽然多语言 预训练 PIXEL-M4 具有更强的初始性能,但其后续适应能力似乎受到限制,而采用混合脚本的单语言模型 PIXEL 可以在句子级任务上产生更多收益。我们的指标和案例研究提供了经验观察,可以帮助您在类似的低资源环境中使用基于像素的模型时为数据选择和脚本适应选择提供信息。