论文

你不应该问:用于评估 LLM 拒绝的语用学分类法

You Shouldn't Have Asked: A Pragmatics-Inspired Taxonomy for Evaluating LLM Refusals

模型评测评测方法与指标

摘要

在实用主义中,拒绝通常被视为威胁面子的行为,因为它们会挑战请求者在社会上声称的自我形象。 大语言模型 (LLM) 越来越多地接受训练来拒绝不安全和不适当的请求,当模型无法正确管理这种交互成本时,这些拒绝可能会伤害用户。虽然现有工作主要将 LLM 不合规作为安全调整结果,但它没有提供一种方法来评估 LLM 是否在不同的有害环境中适当拒绝。为了研究这个问题,我们(据我们所知)提出了基于实用理论的 LLM 拒绝的第一个分类法。将这种分类法应用于 16 个现代 LLM 跨越 14 个伤害类别的反应,我们发现,尽管模型在拒绝方式上有所不同,但他们的拒绝总体上是明确的,并且具有强烈的道德评价性,互动修复主要通过提供或提供更安全的替代方案而不是人际交往来实现。这种模式在敏感的伤害环境中尤其重要,过度使用负面框架可能会让用户感到羞耻或被激怒,从而破坏安全不合规的目的。因此,我们呼吁进行一致性评估,不仅要考虑模型是否拒绝有害的请求,还要考虑它们是否以适应上下文的方式拒绝,并对拒绝的交互后果承担社会责任。