论文
LoMC:路由基础模型中拒绝抑制的局部多向校正
LoMC: Localized Multidirectional Correction for Refusal Suppression in Routed Foundation Models
摘要
我们研究了路由 MoE 和混合 MoE 基础模型中的受控 后训练 拒绝抑制,旨在增加非拒绝目标响应行为,同时在紧凑的干预足迹下保留一般能力。现有的基于广泛方向的编辑可能会干扰通用计算,而仅支持专家编辑通常缺乏足够的能力来纠正异构拒绝表示。为了解决这个限制,我们引入了局部多向校正(LoMC),这是一种支持门控干预框架,遵循支持然后校正的执行顺序:它首先识别紧凑的编辑支持,然后将原型校正方向聚合为逐层校正方向,最后仅在选定的支持内应用一级逐层校正。通过使用编辑支持作为结构门控约束,LoMC 在不扩大干预范围的情况下增加了校正能力。对四个路由骨干网的纯文本和多模式安全基准进行的实验表明,LoMC 显着改善了非拒绝目标响应行为,同时在紧凑的干预足迹下保持了一般能力。