论文
在您不确定的地方使用专家:混合专家 LoRA 的置信自适应路由
Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA
摘要
低秩适应 (LoRA) 的专家混合 (MoE) 变体将每个词元路由到固定数量的专家 $k$。词元的不同之处在于模型对它们的不确定性,因此单个 k 在简单词元上花费过多,而在困难词元上花费不足。我们观察到路由器的输出分布已经是每个词元的不确定性信号:峰值质量表示置信度,而平坦的分布表示模糊性。我们引入了 CARE(置信自适应专家路由),它以核心方式接纳专家。专家们被激活,减少路由器的重量,直到他们的累积质量达到阈值,当公认的专家不同意时,会进行小范围的扩展。预算恒温器会校准阈值,以便活跃专家的平均数量与任何目标相匹配。 CARE 是一个简单的单前向传递规则,没有额外的参数。在 LLaMA-3.1-8B 和 Qwen2.5-7B 上的八个常识性基准测试以及数学、代码和知识任务中,CARE 在匹配计算方面比固定 top-k MoE-LoRA 有所改进,并匹配固定 k=4 基线,同时激活更少的专家。同样的置信度和不一致信号还可以改善 MSP、熵和多通道代理的分布外检测。我们以核心保真度、预算最优性和对分歧的认知解读来支持设计,并发布代码。