论文

LASA:在语义瓶颈处进行跨语言语义对齐以提升大模型安全性

LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety

模型训练监督微调与指令调优

摘要

大语言模型(LLM)通常在高资源语言中具有较好的安全表现,却在低资源语言提问下暴露严重漏洞。研究将这一差距归因于两种能力的不匹配:模型具备与语言无关的语义理解能力,但安全对齐仍偏向高资源语言。与这一假设一致,实验识别了大模型中的语义瓶颈,即模型表征几何主要由共享语义内容、而非语言身份决定的中间层。基于这一发现,研究提出语言无关语义对齐(LASA),将安全对齐直接锚定到语义瓶颈。实验表明,LASA显著改善了各语言的安全性:LLaMA-3.1-8B-Instruct的平均攻击成功率(ASR)从24.7%降至2.8%,在Qwen2.5和Qwen3 Instruct模型(7B–32B)上约为3%–4%。研究从表征层面解释大模型安全性,指出安全理解应锚定到模型的语言无关语义空间,而非表层文本。