论文

Scratchpad 修补:在字节级语言模型中将计算与修补程序大小解耦

Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models

模型架构新型架构

摘要

无分词器的语言模型通过直接对字节进行操作,消除了语言建模管道的分词器步骤;基于补丁的变体进一步将连续的字节跨度聚合成补丁以提高效率。然而,在模型设计阶段选择的平均补丁大小决定了一个严格的权衡:较大的补丁会减少计算和 KV 缓存占用空间,但会降低建模质量。我们将这种权衡追溯到补丁滞后:在完全观察到补丁之前,其中的字节预测必须依赖于前一个补丁的陈旧表示来保留因果关系;随着斑块变大,这种滞后会扩大。我们引入了暂存器补丁(SP),它在每个补丁中插入瞬态暂存器,以聚合迄今为止看到的字节并刷新补丁级上下文以进行后续预测。 SP 使用下一个字节预测熵触发暂存器,选择性地将计算分配到信息密集区域,并启用推理时间计算的事后调整。在自然语言和代码的实验中,SP 在相同 patch 大小下提高了模型质量;例如,即使每个补丁的字节数为 16 美元,SP 增强模型也能匹配或接近下游评估的字节级基线,同时使用比补丁小 16 倍的 KV 缓存以及减少 3 美元到 4 倍的推理计算。