论文

用分层注意力检测长对话中的多轮越狱

Scalable Hierarchical Attention Transformers for Multi-Turn Jailbreak Detection in Long Conversations

AI 基础设施AI安全与内容治理基础设施

摘要

多回合越狱可以通过逐步升级、重构和角色操纵在对话中传播不安全意图,从而逃避回合级别的审核。我们将多轮越狱检测作为会话级分类问题来解决,并引入一种高效的分层检测器,避免昂贵的长上下文连接,同时保留交叉轮推理。该模型对各个回合进行编码以形成紧凑的回合表示,并应用轻量级对话模块来捕获对话动态并在需要时有选择地关注细粒度证据。在 14,038 次对话的挑战性评估基准上,我们的方法实现了 0.9394 的 F1,比最强的竞争基准 Claude Opus 4.7 好 0.07,同时误报率减半。消融研究证实,每个架构组件都做出了有意义的贡献,在对话模块中结合交叉注意力和自注意力,与仅自注意力的变体相比,误报率降低了 2.26 个百分点。