论文

THESIS-MoE:混合专家中谄媚性的可训练层级提取与引导

THESIS-MoE: Trainable Hierarchical Extraction and SteerIng of Sycophancy in Mixture-of-Experts

模型推理模型架构MoE解码与生成控制

摘要

谄媚(sycophancy)指语言模型改变自身答案以迎合用户所述信念的倾向,是一种常见的对齐失败。现有激活引导方法通常在整个模型中统一施加单一对比方向,这是一种无条件干预,即便没有谄媚行为时也会改变激活,以知识保留换取行为矫正。在混合专家(MoE)模型中,先前工作进一步表明行为编码在专家计算之中而非仅在于路由决策,使得精确的行为引导尤为困难。在这项工作中,我们引入一个共享对比信号,它由带与不带所述信念的匹配提示构建,用于定位谄媚在MoE层级中的所在,并驱动只在其行为出现处施加的干预。我们将定位形式化为对MoE块、专家、注意力块与注意力头这一粒度阶梯上的因果搜索,并将无条件减除与两种条件式替代方案比较:解析的基于投影的减除,以及一个按token学习的门控,在保持权重冻结的同时将模型引离谄媚。我们在三个MoE模型上评估,同时测量谄媚与通用知识及推理基准。我们的条件干预最多消除了90%由信念诱发的谄媚。结果表明谄媚位于可识别的计算子回路中,可以在保持良好消除-保留权衡的同时被选择性引导。

THESIS-MoE:混合专家中谄媚性的可训练层级提取与引导:论文配图
图1:干预单元。每个注意力头和专家都带有一个门控 m;被门控的贡献 A_i 和 M_i 在输出流处同样包含门控机制。