论文

REFLECTOR:内化针对间接越狱的逐步反思

REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak

模型训练监督微调与指令调优

摘要

虽然 大语言模型 (LLM) 展示了卓越的功能,但它们仍然容易受到复杂的多步骤越狱攻击,这些攻击通过利用内部生成过程来规避传统的表面级安全对齐。为了解决这些漏洞,我们提出了 Reflector,这是一个原则性的两阶段框架,可在生成轨迹中内化自我反思。 Reflector 首先利用教师指导生成为受监督的 微调 (SFT) 生成高质量的反射数据,从而建立结构化的反射模式。随后,它使用强化学习 (RL) 以及结果驱动和奖励有效性监督来灌输强大的自主自我反思能力。实证结果表明,Reflector 针对复杂的间接攻击实现了超过 90% 的防御成功率 (DSR),同时在不同的威胁场景中具有稳健的泛化能力。值得注意的是,该框架增强了特定任务和通用实用性,在 GSM8K 上实现了 5.85% 的增益,同时提高了知识密集型基准测试的性能。通过内化轨迹级安全性,Reflector 克服了表面对准的基本限制,无需大量计算开销,为开发安全且功能强大的 LLM 提供高效且可扩展的解决方案。