论文

GlitchPatch:通过局部重新分词修复冻结语言模型中的故障token

GlitchPatch: Repairing Glitch Tokens in Frozen Language Models via Local Retokenization

模型推理解码与生成控制

摘要

Glitch token是异常词汇条目,可能导致大语言模型 (LLM) 产生与其输入不一致的输出。现有的修复方法需要访问模型内部结构,这对于冻结的检查点来说是不切实际的。我们研究是否可以通过优化输入分词在模型外修复故障token。对 BPE 合并规则删除的实证研究表明,(1) 删除故障token的合并规则可以修复很大一部分故障,但破坏共享中间合并节点的正常token会导致总体故障率上升;(2) 不同的分解粒度会产生非单调修复率,而正常token的附带损害单调增长。受这些发现的启发,我们提出了 GlitchPatch,一种基于局部重新分词的冻结语言模型的修复框架,由两个阶段组成:离线阶段使用行为路径优化(BPO)为每个故障token找到行为最佳的替换token序列,并将经过验证的替换编译到规则表中;在线阶段仅替换规范token序列中匹配的故障token的 ID,而不修改模型参数或内部状态。对涵盖 6 个tokenizer 系列的 10 个模型进行的实验表明,GlitchPatch 实现了 85.10% 的平均修复率,比最强基线高出 14.37 个百分点,并将平均故障率从 14.88% 降低到 2.27%。 GlitchPatch 在全词汇评估中实现了 0.00% RR,并在设计上保持了规则不匹配的输入不变。我们从时间成本、语言理解和能力的角度进一步评估修复的实际影响,支持其部署可行性。我们希望这项工作为提高分词器的可靠性提供一个实用的选择。

GlitchPatch:通过局部重新分词修复冻结语言模型中的故障token的原论文方法或结果图
图 5:两阶段 GlitchPatch 框架。离线阶段使用 BPO 搜索每个故障token的行为最佳替换序列,并将验证结果编译到规则表中。在线阶段对规范分词输出执行预算受限的本地 ID 替换。