论文
SSRFT:通过安全角色内化改进 LLM 安全泛化
Beyond Refusal Patterns: Safe-Role Internalization for Robust and Generalizable LLM Safety Alignment
摘要
大语言模型 (LLM) 已经实现了卓越的功能,但仍然容易受到越狱攻击,从而引发有害或不安全的输出。现有的安全对齐方法,包括监督微调 (SFT) 和人类反馈强化学习 (RLHF),通常需要大量针对特定攻击的监督和计算资源,同时仍然容易受到浅层安全对齐和过度拒绝的影响。为了应对这些挑战,我们引入了 SSRFT(监督安全角色微调),这是第一个将安全对齐重新表述为预定义安全角色的内部化的框架。 SSRFT 根据心理测量问题、有限的越狱提示和安全角色描述构建安全角色问答 (SRQA) 数据集。角色一致的响应被综合、验证并扩展到不同的场景中,使模型能够内化以安全为导向的价值观和原则,而不是明确的拒绝模式。跨多个 Base 和 Instruct 模型的实验表明,SSRFT 比标准 SFT 实现了更稳健和更通用的安全对齐。 SSRFT 对预填充攻击表现出极大的鲁棒性,并对未见过的越狱域具有更好的泛化能力,同时减少了对良性查询的过度拒绝并保留了模型的一般功能。这些结果将安全角色内化确立为以拒绝为中心的安全调整的有效替代方案。警告:本文包含有害和有毒语言的示例。
