论文
一张图像,没有标记:基于字形的中文语言建模的对照研究
One Image, No Tokens: A Controlled Study of Glyph-Based Chinese Language Modeling
摘要
现代语言模型通常将文本表示为离散标记嵌入的序列,这一假设深深植根于当前实践,但很少受到质疑。我们通过用字符序列的单个光栅化图像完全替换基于索引的标记嵌入来挑战这种表示,特别是对于中文,该图像由共享 ResNet 和浅层 Vision Transformer 组成的视觉编码器处理。为了隔离输入表示的作用,我们构建了一个双分支控制框架,其中基于视觉的模型和基于索引的基线共享相同的解码器主干、训练目标、优化器和数据课程。因此,任何性能差异仅可归因于输入模式。在所有测试的解码器主干中,基于视觉的模型始终优于基线,达到了 0.429 的峰值准确度,而基于索引的基线为 0.355,相对提高了 21%,同时收敛时间约为训练时期数的一半。这种优势尤其出现在前五个时期(占总数据的 21% 以下),并且在中度字符损坏的情况下仍然存在:损坏的 Vision 模型与基于索引的 \emph{clean} 基线相匹配。消融研究表明,该优势需要空间相干输入和具有 2D 位置编码的 ViT 编码器。对英语的跨文字比较表明,这种优势并没有直接转移到字母书写系统,这表明汉字统一的视觉密度和部首结构是有利条件。这些发现表明,Transformer 比通常假设的更加模态不可知,并且离散标记化不是中文建模的基本要求。