易于预测,难以计算:边界依赖找到熵修补遗漏的计算输出
Easy to anticipate, hard to compute: boundary dependence finds the computed outputs that entropy patching misses
摘要
字节级语言模型(例如字节潜在Transformer (BLT))将字节分组为补丁,并为每个补丁运行一次大型全局模型。 BLT 在小模型的下一个字节熵较高的地方启动一个补丁,因此全局计算会在下一个字节难以预测的地方进行。我们证明这个规则有一个系统盲点:其类型是可预测的,但其值必须计算的位置,例如数学解决方案中“=”后面的数字。在紧张的补丁预算下,熵触发的布局会跳过这些位置,并且它们的准确性会崩溃。在 Meta 的 BLT-1B 中,补丁从 10% 的字节开始,熵规则将补丁从 GSM8K 解决方案中计算结果的 16% 开始,并得到其中的 19.0% 完全正确;相同补丁计数的每个“=”后面的边界获得 51.8%,与无标签边界相关信号相结合的熵获得 67.1%(26% 字节的默认布局:76.8%)。通过低阶微调使 BLT-1B 适应预算(32.9% 与 72.7%,每个规则运行 3 次,配对 p < 1e-200),这一差距仍然存在,并且随着训练的字节模型中的模型大小而增长 从 10% 的预算开始:在 1M、12M 和 50M 参数下,边界依赖在最终答案上击败熵 -1.6、+10.1 和 +19.8 个点,在 50M 时,它获得了 35.9% 的计算结果,而 13.9%(每个 3 个种子)。 BLT 的熵跳跃规则对 50M 目标没有帮助。便签本修补的熵触发同样与最终答案上的随机便签本无法区分(5.6% vs 5.9%,5 个种子),而答案开始便签本的熵触发率为 38.1%。该效果特定于计算值:复制和查找几乎没有增益,而模型无法计算的值则没有任何增益。边界依赖性,即当补丁开始被移除时模型自身损失的增加,每两个字节上下文进行测量,找到这些没有标签的位置:与熵相结合,它在计算结果上击败了手写规则。