论文

通过动态语义路由校准减少 LLM 过度拒绝

Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibratione

模型推理解码与生成控制

摘要

为安全而调整的大型语言模型 (LLM) 经常会遭受过度拒绝、错误地拒绝良性但与安全相关的指令的困扰。先前的研究主要将此归因于静态表示重叠,很大程度上忽略了潜在的动态机制。在本文中,我们通过Transformer注意力内的内部路由冲突的角度提出了过度拒绝的机制分析。我们发现,超敏感安全头的稀疏子集在硬安全提示上失败,表现出异常的注意力纠缠,将无害的目标实体强制绑定到拒绝语义。这会引发严重的高熵路由冲突,从而使目标实体失去必要的关注。为了解决这个问题,我们提出了语义路由校准(SRC),这是一种轻量级、免训练的推理框架。 SRC 在推理阶段精确定位并动态抑制这些超敏感的安全头。再加上双分支 Logits 融合(在后续解码过程中充当安全正则器),SRC 无缝地恢复了可信推理。大量实验表明,SRC 可以减少过度拒绝,并尽可能保留本质安全性能。