论文

资源匮乏的非洲语言的潜在空间拒绝锚定:无需再训练的机械安全恢复

Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining

模型推理解码与生成控制

摘要

经过指令调整的模型通常会拒绝英语中的有害请求,但会遵守约鲁巴语、伊博语、伊加拉语和豪萨语的相同请求。这表明拒绝机制存在于残余流中,但无法针对低资源输入激活。恢复它通常需要标记的目标语言数据和再训练,这对于大多数非洲语言来说都无法大规模实现。我们引入了潜在空间拒绝锚定(LSR-Anchoring),这是一种 无需训练 方法,可以从英语提示中提取拒绝方向,并在推理时将其固定到残余流上。主要变体平均激活转向 (MAS) 在我们测试的四种架构中运行:Llama-3-8B、Llama-3.1-70B、Mistral-7B-Instruct 和 Qwen2.5-7B。在 Mistral 和 Qwen 上,它以低于 0.08 的良性退化恢复了安全性。在 Llama-3-8B 上,它矫枉过正,合法提示下的性能下降 (DPL) 达到 1.00。我们通过 SAE 派生转向 (SDS) 解决了这个问题,它用单个稀疏自动编码器 (SAE) 功能取代了密集均差方向,并将 Kullback-Leibler (KL) 散度减少了 3.5-7 倍,而没有良性崩溃。四种语言都在积极迁移,但阿拉伯语在每种架构和每种转向幅度上都失败了,这表明几何不匹配而不是基线效应。在每个有效转向幅度下,大规模多任务语言理解 (MMLU) 准确度下降幅度仍低于 0.35 个百分点。