论文

DDOR:用于可解释的过度拒绝测试和修复的 Delta 调试

DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair

模型评测评测方法与指标

摘要

虽然安全对齐和护栏有助于 大语言模型 (LLM) 避免有害输出,但它们也可能导致过度拒绝,即无理拒绝仅仅看起来有风险的良性查询。我们提出了 DDOR(过度拒绝的 Delta 调试),这是一个完全自动化且可解释的框架,用于在黑盒设置中进行过度拒绝测试和修复,其中只有模型输入和输出可访问,内部安全机制保持不透明。 DDOR 应用增量调试来本地化最小的拒绝触发片段 (mRTF),这些片段为拒绝发生的原因提供短语级的、可解释的证据。以这些 mRTF 为条件,DDOR 生成多样化、上下文丰富的提示,并执行多预言机验证以过滤本质上不安全或不明确的案例,从而生成可扩展且特定于模型的过度拒绝测试套件(每个模型大约 1K 个案例)。除了评估之外,我们还进一步利用本地化的 mRTF 来执行有针对性的即时修复,大大减少过度拒绝,同时保留原始意图并维护真正有害输入的安全。总体而言,DDOR 提供了实用的端到端解决方案来评估和减轻过度拒绝,从而在不牺牲安全性的情况下提高 LLM 的可用性。