论文

谁来架起安全的桥梁:识别并定向跨语言共享安全通路

Who Bridges Safety? Identifying and Targeting Cross-Lingual Shared Safety Pathways

模型评测模型行为与机制分析

摘要

揭示大语言模型(LLM)安全能力背后的内部机制,对构建可信赖人工智能至关重要。目前,针对多语言安全的机制可解释性研究大多局限于孤立神经元等局部组件。然而,这种静态、碎片化的视角忽视了组件间的协同,也无法阐明安全信号如何在模型内动态传播并最终驱动安全决策。本工作超越孤立神经元,识别并以安全信号传播过程中形成的跨层功能通路为作用对象,从而揭示驱动跨语言安全鸿沟的机制。具体而言,我们首先识别单语安全通路并验证其对拒绝有害请求的影响。随后的跨语言分析发现了一个稀疏的跨语言共享安全通路子集,证实这一交集承担着把安全能力从高资源(HR)语言迁移到非高资源(NHR)语言的内部桥梁作用。基于这些机制发现,我们提出一种以跨语言共享安全通路为靶向的通路级对齐方法。实验结果表明,仅更新一小部分通路参数即可显著提升NHR语言的安全性,同时大体保留模型的通用能力。

谁来架起安全的桥梁:识别并定向跨语言共享安全通路:论文配图
图1:多语言安全失衡与潜在路由失败。(左)尽管LLM能够理解NHR语言,却无法拒绝NHR有害查询。(右)HR意图能可靠地触发安全通路,而NHR意图则绕过这些通路,未能拒绝有害查询。