论文

MoE推理群体的路由有效秩:从集中到分化再到聚合

From Concentration to Differentiation and Back: Routing Effective Rank in MoE Reasoning Cohorts

模型评测模型架构MoE模型行为与机制分析

摘要

测试时间缩放会产生大量推理展示,但没有标准的无标签说明来说明随着推理的展开,内部计算如何重新组织。我们引入了路由有效等级 deff,即根据 MoE 专家路由相似性构建的交叉推出图的熵有效维数。在 10 个 MoE 配置和 5 个数学/科学基准中,deff 表现出可重复的低-高-低轨迹,在 3,105 个模型问题队列中的 98.5% 中具有显着的内部最大值:路由相似性在早期集中,在中间预算时最大程度区分,然后重新集中,并且该最大值的时间随架构和推理工作而系统地变化。精确的分解将队列范围内的共模质量与残余频谱维数分开:共模重新分配约占轨迹的三分之二,而残余频谱贡献约四分之一并保留超出共模的实质性变化。分解进一步本地化行为:在非一致队列中,共模浓度的增加强烈预测相同答案的可恢复性,更高的推理努力将最大值延迟 2.59 个倍频程(Token预算的两倍),并在所有四个测试架构中一致扩展高秩周期,将努力效果定位在时间和持续时间而不是峰值幅度上。正确性比较将结构监控与答案选择分开,将路由有效排名定位为队列组织的可分解、无标签诊断——一个关于 MoE 推理队列如何在推理时间内区分和重新集中的原则光谱镜头。

MoE推理群体的路由有效秩:从集中到分化再到聚合:论文配图
图 A3:轨迹是每个队列的事实,而不是聚合效应。 3,1053{,}105 行中的每一行都是一个(模型、问题)群组,在行内标准化并按其峰值预算排序;左边的条纹给出了建筑结构。亮带沿对角线延伸——排序构成了对角线;带的对比度(而不是对角线)承载了信息,并且体系结构条纹显示了汇集峰值如何结合特定于体系结构的时钟:OSS-20B 队列集中在早期峰值,Qwen3-Next-80B 队列集中在晚期峰值。