论文
超越“我无法满足此请求”:通过标签增强减轻 LLM 中的严格拒绝
Beyond "I cannot fulfill this request": Alleviating Rigid Rejection in LLMs via Label Enhancement
摘要
大语言模型 (LLM) 依靠安全对齐来遵守安全请求,同时拒绝有害请求。然而,传统的拒绝机制往往会导致“刚性拒绝”,即通用模板(例如“我无法满足此请求”)不加区别地触发拒绝,严重破坏了人类与 LLM 之间交互的自然性。为了解决这个问题,本文提出了 LANCE,通过标签增强来确保安全、灵活和自然的响应。具体来说,LANCE 采用变分推理来执行标签增强,预测跨多个拒绝类别的连续分布。这些细粒度的拒绝分布为细化模型提供了多路文本梯度,以中和提示中的危险元素,以便 LLM 可以生成安全的响应,避免严格的拒绝,同时保持交互的自然性。实验表明,LANCE 显着缓解了刚性拒绝问题,同时保持了高安全标准,在响应的有用性和自然性方面显着优于现有的基线模型。