论文

通过模型自反思与单个神经元的轻量对齐提升 LLM 安全性

Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron

模型推理解码与生成控制

摘要

大语言模型(LLM)的安全性日益成为其发展的一个根本方面。现有的 LLM 安全对齐主要通过后训练方法实现,计算成本高昂,且往往难以跨不同模型良好泛化。少数轻量级对齐方法要么严重依赖预先计算好的安全注入,要么过度依赖模型自身能力,导致泛化受限,并在生成过程中出现效率与可用性的下降。在这项工作中,我们提出一种安全感知解码方法,只需对专家模型进行低成本训练,并采用单个神经元作为门控机制。通过有效平衡模型内在能力与外部引导,我们的方法在保持效用的同时提升输出安全性。它在训练开销与跨模型规模泛化上展现出明显优势,为大语言模型的安全且实用部署提供了一种轻量级对齐的新视角。代码:https://github.com/Beijing-AISI/NGSD。

通过模型自反思与单个神经元的轻量对齐提升 LLM 安全性
图1:Neuron Guided Safe Decoding(NGSD)流程概览。