论文

超越不安全检测:多轮大语言模型安全失败的反事实锚定证据归因

Beyond Unsafe Detection: Counterfactually Anchored Evidence Attribution for Multi-Turn LLM Safety Failures

模型评测评测方法与指标

摘要

随着大型语言模型(LLM)从对话助理转向高级代理系统,护栏故障可能会将对抗意图转化为有害的执行。然而,大多数护栏评估框架只关注结果并评估用户请求是否安全。这种方法不足以应对多回合失败,因为对抗意图分布在多个回合中。这促使我们超越检测范围,识别将对话推向不安全轨迹的转弯和标记。为了支持这一点,我们构建了一个具有行为验证和分层证据监督的多轮数据集。该数据集包含 1,762 个对话,包括对抗性对话、良性双胞胎以及具有高风险词汇的良性变体。我们训练了一个轻量级的分层归因模型,该模型可以预测安全违规行为并将其归因于贡献用户回合和词元跨度。该模型实现了强大的检测性能(F1=0.988),并且删除前 15% 的归因标记使对抗性分类置信度降低了 51.1%。该模型在具有高风险词汇的良性对话中保持了较低的误报率,在边缘良性和良性高风险词汇对话中,误报率均低于 1%,而基于关键字的表面风险基线的误报率分别为 37.3% 和 94.7%。独立的人类注释支持模型的归因性能,在 84.5% 的对抗性案例中,排名前五的归因转折包含人类识别的证据转折。