仅仅有相似性是不够的:在专家混合中恢复自由能原理
Affinity Is Not Enough: Recovering the Free Energy Principle in Mixture-of-Experts
摘要
稀疏 MoE 路由在域转换时失败,其中当前词元属于一个分布,而下一个词元属于另一个分布。在受控实验(4 名专家,5 名种子)中,标准关联路由仅将 0.006 +/- 0.001 的概率分配给转换时正确的专家。三个轻量级门修改将其提高到 0.748 +/- 0.002 (124x),将 99% 覆盖率所需的专家从不可行削减到一个小常数:时间记忆(beta),每个专家的 LIF 膜潜力累积跨词元的路由上下文;精确加权门控 (Pi),每个专家最近预测误差的逆方差,在可靠和不可靠专家之间产生 31 倍的对比度;预期路由,一个以 beta 累积隐藏状态为条件的下一个状态预测器。该机制借鉴了 Friston 的自由能原理,并使用尖峰神经网络的 LIF 动力学。对所有 2^3 子集的消融揭示了超级加性 beta x Ant 相互作用:单独的预期什么也没有给出(+0.000 +/- 0.001); beta 单独提供适度增益 (+0.295 +/- 0.013);他们合计缩小了 75% 的预言机差距(+0.741 +/- 0.002,超出总和 +0.446 +/- 0.014)。这是结构性的:无状态预测器无法检测接近的转换,因为转换前标记在分布上与域内标记相同。在字符级 MoE LM(5 个种子)中,beta 路由将转换步骤 BPC 从 6.56 +/- 0.01(标准)减少到 4.01 +/- 0.15(beta-MoE);在该领域出现在输入中之前,beta + Ant 门将 0.86 +/- 0.02 的概率置于正确的领域专家上,而标准 MoE 的概率为 0.42 +/- 0.12。参考实现(每个约 200 行):https://github.com/russellwmy/affinity-is-not-enough