论文
德克萨斯州:下游专家混合的任务专家感知监督 LLM 适应
TEXAS: Task-Expert-Aware Supervision for Downstream Mixture-of-Experts LLM Adaptation
摘要
专家混合 (MoE) 语言模型通过一小部分专家来路由每个标记,使得路由模式对于在下游适应期间识别与任务相关的专家非常有用。然而,当前的方法有两个局限性:任务专家通常是根据反映使用情况的聚合路由统计数据来识别的,而不是与成功任务完成的关联,并且任务专家激活作为监督分配的信号仍未得到充分探索。我们引入了任务专家感知监督(TEXAS),它将正确性条件的任务专家发现与 词元级 监督分配相结合。 TEXAS 比较基础模型成功解决的实例和未能解决的实例上的专家激活,并在成功的实例上保留更强烈的专家激活。在 微调 期间,当激活这些专家时,它会增加失败实例中答案词元的权重。因此,TEXAS 利用现有的路由行为,而不限制对固定专家子集的适应或强加明确的目标路由分布。在三个 MoE 模型和 6 个基准测试中,TEXAS 在 18 个设置中的 17 个设置中实现了最佳或并列最佳性能,并且比最强基线平均提高了 1.3--1.5 个点。消融和进一步分析验证了发现的专家和由此产生的监督策略。