论文

STAR-S:基于安全规则自学推理的安全对齐改进

STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules

模型训练监督微调与指令调优

摘要

防御越狱攻击对大语言模型(LLM)的安全部署至关重要。近期研究尝试通过训练模型在响应前对安全规则进行推理来提升安全性。然而,一个关键问题在于确定何种形式的安全推理能有效防御越狱攻击,而这难以显式设计或直接获得。为解决这一问题,我们提出 STAR-S(基于安全规则的自学推理),一个将安全规则推理的学习融入自学循环的框架。STAR-S 的核心是在安全规则引导下引出推理与反思,然后利用微调来增强安全推理。重复这一过程形成一个协同循环:模型对安全规则的推理与解读能力的提升,使其能够在安全规则提示下产出更好的推理数据,这些数据进而被用于进一步训练。实验表明,STAR-S 能有效防御越狱攻击,优于各基线。代码见:https://github.com/pikepokenew/STAR_S.git。

STAR-S:基于安全规则自学推理的安全对齐改进 配图
图 1:自学式推理过程概览。STAR-S 引导模型对安全规则进行推理与反思;随后模型在这些数据上进行微调,并重复这一过程以改进安全规则推理。