论文
MIXAR:将基于像素的自回归语言模型扩展到多种语言和脚本
MIXAR: Scaling Autoregressive Pixel-based Language Models to Multiple Languages and Scripts
摘要
基于像素的语言模型作为传统基于标记的方法的替代品正在获得发展势头,有望规避标记化挑战。然而,跨语言固有的感知多样性给像素空间中的多语言泛化带来了重大障碍。本文介绍了 MIXAR,这是第一个基于像素的生成语言模型,利用一系列不同的脚本对八种不同的语言进行了训练。我们根据之前的基于像素的模型以及基于标记器的模型对 MIXAR 进行了实证评估,证明了在判别性和生成性多语言任务方面的显着性能改进。此外,我们还展示了 MIXAR 如何对训练期间从未见过的语言具有鲁棒性。当将模型扩展到 0.5B 参数时,这些结果得到进一步加强,这不仅提高了其在 LAMBADA 等生成任务中的能力,而且还提高了其在面临正交攻击等输入扰动挑战时的鲁棒性。