论文
LLM 中稳健的有害意图探测的段级一致性
Segment-Level Coherence for Robust Harmful Intent Probing in LLMs
摘要
大语言模型 (LLM) 越来越多地受到自适应越狱的影响,特别是在高风险的化学、生物、放射和核 (CBRN) 领域。尽管流式探针可以实现实时监控,但它们仍然会产生系统错误。我们发现了一个核心问题:现有方法通常依赖于一些高分标记,当敏感的 CBRN 术语出现在良性上下文中时,会导致误报。为了解决这个问题,我们引入了一个流式探测目标,它需要多个证据词元来一致支持预测,而不是依赖于孤立的峰值。这鼓励基于聚合信号而不是单个标记线索进行更强大的检测。在固定的 1% 假阳性率下,我们的方法相对于强流基线将真阳性率提高了 35.55%。我们进一步观察到 AUROC 的大幅增长,即使是从接近饱和的基线性能开始(AUROC = 97.40%)。我们还表明,探测注意力或 MLP 激活始终优于残差流特征。最后,即使对抗性 微调 启用新颖的字符级密码,有害意图仍然可以检测到:为基础 LLM 开发的探针可以“即插即用”地应用于这些混淆攻击,实现超过 98.85% 的 AUROC。