论文

字节建模中的效率差距

The Efficiency Gap in Byte Modeling

模型评测模型行为与机制分析

摘要

现代语言模型历来依赖于两种主要的设计选择:子词标记化和自回归(AR)排序。这些设计决策会影响模型的学习先验。最近,两种替代范式对此提出了挑战:字节级建模(绕过静态统计派生的词元词汇表)和掩码扩散建模(MDM)(进行并行、非顺序生成)。它们的交集代表了一个完全端到端的与模态无关的生成原型;然而,去除这些结构先验会产生大量的计算成本。在这项工作中,我们通过计算匹配的扩展研究来调查这一成本。我们的结果表明,字节建模的性能损失并不均匀;在规模上,字节建模的扩展开销对于 MDM 来说比 AR 更糟糕。我们假设这种差异源于上下文脆弱性:虽然 AR 稳定的因果历史允许模型自然地重新发现子词模式,但 MDM 目标破坏了从原始字节有效解析语义所需的局部连续性。我们从受控排列实验中得到的结果表明,未来的模态不可知设计必须纳入替代的结构偏差,以维持字节体系中可行的扩展轨迹。