论文
拒绝门控解码:高温采样下保持拒绝行为
Refusal-Gated Decoding: Preserving Refusal Behavior Under High-Temperature Sampling
摘要
高温采样是增加LLM多样性的主要机制之一。基于截断的采样技术的新进展帮助缓解了高温采样的缺点(如神经文本退化),从而在不牺牲连贯性的情况下实现更大的输出多样性。但经高温提高token概率分布的熵也被证明会削弱模型护栏——降低模型面对有害提示时的拒绝响应。尽管高温采样有潜在收益且维持模型安全很重要,现有方案缺乏在高熵区间维持LLM拒绝行为的手段。为填补该空白,我们系统研究温度如何影响LLM拒绝行为,并提出一种高效的顺序解码方法:在高温下保持模型贪婪解码的拒绝响应、而引入的额外延迟极小。大量实验显示:该方法在三个基准数据集上保持91–99%的贪婪解码拒绝行为,同时不损害模型对安全提示的高温响应。本工作展示了需要高温采样的应用如何以高效方式维持拒绝行为。
