论文
思考步骤如何影响模型安全?面向LRM的基于熵的安全提醒
How Does the Thinking Step Influence Model Safety? An Entropy-based Safety Reminder for LRMs
摘要
大型推理模型(LRM)通过显式思考步骤取得了显著成功,但思考步骤也引入一种新风险:可能放大不安全行为。尽管存在这一脆弱性,传统防御机制仍然无效,因为它们忽视了LRM独特的推理动态。在本工作中,我们发现思考步骤中安全提醒短语的出现对保障LRM安全起着关键作用。受此发现启发,我们提出SafeRemind,一种解码期防御方法,在思考步骤中动态注入安全提醒短语。SafeRemind利用熵触发器在决策锁定点进行干预,将潜在有害的生成轨迹引向更安全的结果,且无需任何参数更新。在五个LRM和六个基准上的大量评估表明,SafeRemind显著提升安全性,改善幅度最高达45.5个百分点,同时保持核心推理效用。
