论文
共享前缀代码生成下的逐层 MoE 路由局部性:词元身份分解和编译等效分叉冗余
Layer-wise MoE Routing Locality under Shared-Prefix Code Generation: Token-Identity Decomposition and Compile-Equivalent Fork Redundancy
摘要
在基于 LLM 的代码生成中,通常会根据同一提示并行生成多个候选代码 - 例如,在 best-of-N 采样或多候选代码完成中。这些请求可以通过公共前缀共享 KV 缓存,但它们的专家混合 (MoE) 专家路由重叠的程度,以及这种重叠如何跨层变化,仍然没有得到充分的了解。我们通过从共享前缀(851 个完整代码,温度 0.7)执行基于树搜索的分支生成来研究 Qwen3.5-35B-A3B-FP8(256 个路由专家,top-8),并使用控制词元身份混淆的基于编译器输出的对齐(gcc -S -O0 程序集)分析结果。我们的发现有三个方面:(1)在两个序列生成相同标记的位置,Jaccard 相似度达到 0.649(40 倍随机),而即使在具有不同标记的位置,它仍然为 0.175(11 倍随机)。 (2)逐层分解揭示了交叉模式:所有层中相同词元路由相似性超过不同词元相似性,但在中间层(L14-20)下降,而不同词元相似性在14x随机时在中间层达到峰值。 (3)在树搜索代码生成中,67%的成功编译代码集中在前三个汇编等效组中,99.6%的组内差异由注释和空行组成。我们表明,top-P 搜索(包括波束搜索)的多样性构成了重大挑战。这些结果通过分层分解完善了先前工作的“上下文无关路由”声明,并提出了提高 LLM 代码生成中的搜索效率的机会。