论文

EntropyMoE:面向无分词器大语言模型的熵感知稀疏专家路由

EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs

摘要

近期的字节级大语言模型(LLM)通过将字节分组为动态大小的patch,使无分词器建模日益具有竞争力。然而,现有字节patch架构仍对每个patch施加相同的稠密前馈计算。这种统一计算无法使模型容量适应patch语义与粒度的变化。我们用EntropyMoE来解决这一局限,这是一种为动态字节patch设计的混合专家(Mixture-of-Experts, MoE)架构。EntropyMoE用Top-K专家层替换全局patch Transformer中的稠密前馈模块。每个动态patch作为专家路由的基本单元,其字节覆盖范围决定其在工作负载核算中的贡献。路由器直接从patch熵中选择专家,利用支撑动态patch构建的同一粒度信号来组织稀疏计算。patch熵与长度共同定义了调控专家特异化的特征空间。实验表明,EntropyMoE在匹配的稠密与稀疏基线中取得最低的留出bits-per-byte,同时保持可比的下游准确率。这些结果确立了patch熵作为稀疏条件计算的有效路由坐标,并将混合专家建模拓展到基于分词器的表示之外。

EntropyMoE:面向无分词器大语言模型的熵感知稀疏专家路由:论文配图
图3:EntropyMoE中的逐层路由。专家在各层内部依据其被分配patch的平均熵独立排序(排名1为最低,排名8为最高)。左:按字节加权的硬Top-2分配质量。右:高熵与低熵硬分配率之差;红色偏向高熵patch,蓝色偏向低熵patch。专家排名并不表示跨层共享的同一性。