论文
超越常规合规:用迷惑性数据培养大模型安全警觉
Beyond Routine Compliance: Cunning Data Cultivates Safety Vigilance in Large Language Models
摘要
安全对齐教会大语言模型识别有害请求并拒绝危险指令,但当有害意图藏在看似无害的语境中时,对齐模型仍可能失败。稳健安全因此同时需要安全边界知识和警觉性,即发现表层语义之下异常前提、误导推理及潜在风险的能力。警觉性要求模型行动前审视请求背后的意图和假设。为培养这种能力,我们提出迷惑性问题:它们未必涉及安全,却含误导前提、非典型推理或微妙矛盾。我们假设,学会看穿这些推理陷阱可迁移到安全关键场景。实验显示,Cunning训练提高了对分布外越狱攻击的鲁棒性,并增强后续安全微调。将Cunning加入已有先进安全对齐流水线后,在所评估设置中达到新的最佳表现,使九组骨干模型与基准组合的平均攻击成功率从17.40%降至15.05%。经过匹配安全微调后的轨迹分析提示,安全判断更可能在有害规划开始前主导回答。条件性理论分析进一步刻画了从迷惑性数据学到的不变性何时能迁移到安全相关输入。这些发现表明,该类数据可增强模型警觉并补充传统安全对齐。
