论文
MESA:通过分散的专业知识改善教育部的安全协调
MESA: Improving MoE Safety Alignment via Decentralized Expertise
摘要
专家混合 (MoE) 架构可有效扩展 大语言模型 (LLM),通过动态地将输入路由到相关专家,以降低计算成本来实现更大的容量,但引入了一个关键漏洞:安全稀疏性,其中安全能力集中在少数专家身上,使他们容易受到对抗性绕过。同时,传统的对齐方法统一调整所有参数,忽略了它们的功能差异并无意中降低了性能。为了应对这些挑战,我们提出了 MESA(MoE 安全调整),这是一个基于 MoE 的 LLM 的有针对性的调整框架,该框架战略性地分散安全责任,以最大限度地扩大覆盖范围,同时最大限度地减少对公用事业的干扰。基于最优传输(OT)理论,MESA通过两种机制运行:(1)专家容量重新分配使用传输成本矩阵将安全职责分配给最具成本效益的专家,(2)动态路由细化约束路由器精确激活这些分散的模块。实验表明,MESA 针对各种有害基准实现了强大的防御性能,同时保留了有用性。代码可在 https://github.com/lorraine021/MESA 获取。