论文

查找并重新激活训练后的 LLM' 隐藏安全机制

Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms

模型评测模型行为与机制分析

摘要

尽管通用 大语言模型 (LLM) 的性能令人印象深刻,但它们通常需要 微调 或 后训练 才能出色地完成特定任务。例如,DeepSeek-R1系列等大型推理模型(LRM)在不同的思想链(CoT)数据集上经过后训练不同的通用大语言模型后表现出强大的推理能力。然而,这种额外的训练通常会以降低安全性为代价,因为与 后训练 或 微调 之前的常规 LLM 相比,经过微调或训练后的模型往往会表现出更多有害行为,由于其增强的功能,可能会导致有害结果。以LRM为例,我们首先在本文中调查了这种安全性下降的根本原因。我们的分析表明,后训练 可以掩盖基础 LLM 的原始安全机制,同时过度放大与其 后训练 能力相关的表示。但幸运的是,我们还发现LRM的安全机制仍然存在,而不是在后训练期间被删除。基于这些发现,我们提出了一种名为 SafeReAct 的轻量级且经济高效的解决方案,该解决方案通过与几层上的 LoRA 适配器对齐来恢复受抑制的安全行为。对四种最先进的 LRM 的实验表明,我们的方法在不影响推理性能的情况下显着提高了有害提示的安全性。除了 LRM 之外,其他特定领域 LLM(例如医学模型)的其他结果进一步证实了我们方法的通用性和有效性。