论文
风险之链:大推理模型的安全失效与自适应多原则引导缓解
Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering
摘要
大型推理模型 (LRM) 越来越多地公开类似思想链的推理,以实现透明度、验证和深思熟虑的问题解决。这会产生安全盲点:即使最终答案看起来安全,有害或违反策略的内容也可能出现在推理痕迹中。我们通过在统一的二十原则安全规则下对两个阶段进行评分来测试最终答案的安全性是否足以代表完整的推理答案轨迹。使用来自 7 个公共危害和越狱源的提示,加上 4 个分发外 (OOD) 源,我们评估了每个模型 41K 提示中的 15 个开放权重和基于 API 的 LRM。推理痕迹始终揭示最终答案之外的额外安全风险,尤其是在高严重性的阶段性故障中:泄漏案例,其中不安全的推理先于看似安全的答案,以及逃逸案例,其中看似良性的推理先于不安全的最终响应。原则层面的分析表明,风险集中在错误信息、法律合规、歧视、身体伤害和心理伤害等方面。我们进一步提出了自适应多原则转向,这是一种白盒测试时缓解措施,它根据安全原则学习一个不安全到安全的激活方向,并仅激活当前隐藏状态比安全质心更接近不安全的方向。在三个可引导的开放推理模型上,自适应引导减少了推理跟踪以及保留和 OOD 基准的最终答案中的不安全计数。 DeepSeek-R1-Qwen-7B 在 BBH、GSM8K 和 MMLU 上实现了 40.8% 的平均不安全计数减少,同时保留了 97.7% 的宏观平均精度。这些结果表明,LRM 安全性应该在整个暴露的推理答案轨迹上进行评估和缓解,而不仅仅是在最终答案阶段。
