论文
单词的来源:通过源归因对代码标记器进行有效正则化
From Where Words Come: Efficient Regularization of Code Tokenizers Through Source Attribution
摘要
大语言模型(LLM)的效率和安全性等因素取决于词元化的质量。一个好的分词器不仅可以提高推理速度和语言理解,还可以提供针对越狱攻击的额外防御并降低出现幻觉的风险。在这项工作中,我们研究了代码标记化的效率,特别是从数据源多样性的角度。我们证明,由于训练数据中存储库和语言多样性的不平衡,以及特定源的重复标记占主导地位,这些标记在未来的推理中通常无法使用,代码标记器很容易生成未使用的、因此训练不足的标记。通过修改 BPE 目标并引入合并跳过,我们以源属性 BPE (SA-BPE) 的名义实施不同的技术来规范 BPE 训练并最大程度地减少过度拟合,从而大大减少训练不足的标记数量,同时保持与常规 BPE 相同的推理过程。这提供了适合生产使用的有效工具。