论文

没有可控性的路由敏感性:MoE 语言模型公平性的诊断研究

Routing Sensitivity Without Controllability: A Diagnostic Study of Fairness in MoE Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

专家混合 (MoE) 语言模型对路由级别的人口统计内容普遍敏感,但利用这种敏感性进行公平控制在结构上受到限制。我们引入了公平感知路由均衡(FARE),这是一个诊断框架,旨在探索跨不同 MoE 架构的路由级刻板印象干预的局限性。 FARE 揭示了路由级偏好转变要么无法实现(Mixtral、Qwen1.5、Qwen3),要么统计上不稳健(DeepSeekMoE),要么伴随着巨大的公用事业成本(OLMoE,-4.4%p CrowS-Pairs at -6.3%p TQA)。至关重要的是,即使对数似然偏好变化很稳健,它们也不会转移到解码生成:对两个非空模型的扩展评估在所有生成指标上都会产生空结果。群体层面的专家屏蔽揭示了原因:偏见和核心知识在专家群体中深深纠缠在一起。这些发现表明,路由敏感性对于定型控制来说是必要的,但还不够,并确定了可以为未来更可控的 MoE 系统的设计提供信息的特定架构条件。