论文
REFLEX:将扩散语言模型的MoE推理重构为细化感知计算分配
REFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language Models
摘要
混合专家模型(MoE)通过激活仅一小部分专家来增加参数容量。这种条件计算范式使自回归语言模型能够不增加每个令牌的计算量就扩展模型容量。然而,在扩散语言模型(DLMs)中,每个去噪前向都同时访问所有令牌位置,尽管它们的细化需求差异很大,而默认的固定令牌选择路由则为它们分配了相同的专家预算,导致专家计算与细化需求之间的不匹配。因此,我们认为在DLMs中MoE推理应该被视为在不同令牌细化状态之间分配计算资源的细化-aware计算分配。我们提出REFLEX(\textbf{RE}finement-aware \textbf{FLEX}ible expert allocation),一种无需训练的方法,它保持默认路由器不变,而重新组织专家计算以适应不断变化的细化过程。具体来说,REFLEX引入了一个粗到细的预算分配层次结构,使计算与块相对的细化角色相匹配,同时使用Frontier-Progress Score来解决活跃块优先级。在多个广泛使用的基准测试上,LLaDA-MoE和LLaDA2.0-mini上的REFLEX在平均上减少了分配的专家计算量15%,同时保留或甚至提高大多数基准测试上的生成质量,相对于默认路由。与自回归风格的可变专家路由方法相比,REFLEX还提高了一致性,进一步支持根据每个去噪前向暴露的不一致的细化需求分配专家计算。