论文

标记化如何限制语言模型中的语音知识表示以及如何改进它们

How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve Them

模型评测模型行为与机制分析

摘要

标记化是每个语言模型 (LM) 的第一步,但它从不考虑单词的发音。我们研究标记化如何影响纯文本 LM 表示语音知识的能力。通过一系列的探索实验,我们表明基于子词的标记化系统地削弱了局部(例如,韵律)和全局(例如,音节化)语音特征的编码。为了量化这种影响,我们引入了音节化-标记化对齐距离(STAD),这是一种衡量模型标记化与单词自然音节边界之间错位的指标,并发现较高的错位与较差的语音表示相关,从而为语音感知标记化提供了简单的诊断。为了解决这些限制,我们提出了一种基于 IPA 的轻量级 微调 方法,该方法将语音意识注入到 LM 中,从而在三个语音相关任务中得到一致的改进,同时很大程度上保留了数学和一般推理能力,在 GSM8K 和 MMLU 上分别下降了 1.1% 和 0.9%。