论文

ALTSTEER:选择性安全指导,超越强硬拒绝,转向建设性替代方案

ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives

模型推理解码与生成控制

摘要

安全调整对于部署 大语言模型 至关重要,要求系统防止有害的合规性,同时保留对良性请求的帮助。激活指导提供了 无需训练 推理时间方法来进行安全控制,但有效的安全指导需要解决两个耦合问题:何时进行干预以及干预后应如何形成生成。然而,现有的安全引导方法在两个维度上仍然受到限制,因为它们的触发机制在跨领域可能不稳定,并且以拒绝为导向的引导通常会产生严格的拒绝,而不是建设性的安全引导。为了解决这些限制,我们提出了 ALTSTEER,这是一种推理时间框架,它将选择性干预与单次推理过程中的拒绝锚定的建设性重定向结合起来。 ALTSTEER 使用内部拒绝相关信号来决定何时转向,并应用分阶段转向将生成从拒绝导向控制转向建设性替代方案。对 Llama-3.1 和 Qwen2.5 的评估表明,ALTSTEER 保留了良性效用,同时改善了建设性的安全完成行为,特别是在那些容易对有害请求产生短暂拒绝的模型上。