MoE 专家缓存的可重复评估:重播语义、工作负载污染和操作机制
Reproducible Evaluation of MoE Expert Caching: Replay Semantics, Workload Contamination, and Operating Regimes
摘要
专家混合 (MoE) 模型的加速器内存已经超出,将专家权重卸载到主机内存现在已成为标准。这使得专家缓存管理成为一个有吸引力的杠杆:提高命中率的策略将减少每个词元的专家流量。评估这是一个测量问题,我们发现测量很脆弱。通过三个 MoE 模型(40、64、128 名专家)上的跟踪驱动的事件原子模拟器,我们隔离了三个评估轴,这些评估轴改变了结论,而不仅仅是数字。重播语义:在融合事件流量合约下,不一致的每次访问重播会使基于新近度的策略膨胀 27-29%,同时使基于频率和静态的策略膨胀在 4% 以内,从而颠倒了策略排名。工作负载污染:每个类别使用一个指令模板的探针集会产生逐字相同的生成前缀;配对渲染干预将测得的早期窗口效应移动了 19.4-31.9 个点,并逆转了哪些工作负载看起来最适合缓存。操作机制:归一化的缺失分数不会跨模型转移,因此必须报告相对于每层容量的每步专家联合——然而,仅排列相同事件流的时间顺序会将离线最佳差距从 44.9% 移动到 30.8%,因此这是不够的。修正后,与离线最佳值之间的稳定差距仍然存在(13 个冻结工作负载组合中的 44.2-45.9%)。强制接纳预言机将 84.3-96.6% 归因于了解未来最远使用哪位常驻专家。用作驱逐规则的因果下次使用预测器可以恢复 -11.4% 的差距;它在 3.4% 的时间内选择最佳受害者,而随机驻留块的概率为 2.4%,LRU 和 LFRU 的概率为 20.6-22.1%。我们的立场很狭窄:在我们评估的环境中,巨大的离线最优差距大大夸大了代表性轻量级因果机制恢复的收益。