论文

HodgeCover:高阶拓扑覆盖驱动稀疏专家混合的压缩

HodgeCover: Higher-Order Topological Coverage Drives Compression of Sparse Mixture-of-Experts

模型优化模型压缩

摘要

稀疏专家混合 (MoE) 层通过少数专家路由词元,这些层的免学习压缩可降低推理成本,而无需重新训练。一个微妙的障碍阻碍了这个家族中每个现有的压缩器:三个专家都可以成对兼容,但在合并在一起时形成一个不可约的循环,因此任何对成对信号对专家进行排名的分数在结构上对哪些三元组可联合合并是盲目的。我们证明障碍物是一个精确的数学对象,即 2-复形上的单纯拉普拉斯算子的调和核,其顶点是专家,其边带有 KL 合并障碍,其面带有三重障碍;对边缘屏障信号进行 Hodge 分解可以准确地隔离内核。我们将诊断转化为选择目标:HodgeCover 贪婪地覆盖谐波临界边和三重临界三角形,并且 HodgeCover 的混合变体将其与幸存者的现成权重修剪配对。在积极专家缩减下的三个开放式稀疏 MoE 主干上,HodgeCover 在专家缩减轴上匹配最先进的无学习基线,领先于混合轴的积极压缩前沿,并独特地平衡所有四个 Hodge 组件的保留质量。这些结果表明,暴露学习的 MoE 结构的谐波内核会改变哪个压缩器在最重要的状态下获胜。