论文
通过值过滤解码进行选择性安全转向
Selective Safety Steering via Value-Filtered Decoding
摘要
虽然 大语言模型 (LLM) 经过训练以符合人类价值观,但他们的后代仍然可能违反安全限制。越来越多的工作通过使用安全奖励在解码时修改模型的采样策略来解决这个问题。然而,现有的解码时间引导方法经常进行不必要的干预,修改在基本模型下本应安全的代。这种不必要的干预是不可取的,因为它们可能会扭曲基本模型的关键属性,例如有用性、流畅性、风格和连贯性。我们提出了一种新的测试时引导方法,旨在减少此类不必要的干预,同时提高不安全响应的安全性。我们的方法使用基于价值的安全标准来过滤词元,并为错误干预的可能性提供明确的界限。单个阈值超参数控制这个界限,允许从业者权衡更高的不必要干预率以获得更好的输出安全性。在多个数据集和实验中,我们表明我们的值过滤解码方法优于现有基线,在安全性、有用性和与基本模型的相似性之间实现了更好的权衡。