论文

DeepContext:LLM 多轮对抗意图漂移的有状态实时检测

DeepContext: Stateful Real-Time Detection of Multi-Turn Adversarial Intent Drift in LLMs

模型评测评测方法与指标

摘要

尽管大语言模型(LLM)能力不断扩展,安全护栏大多仍是无状态的,把多轮对话当作一连串孤立事件处理。这种时序意识的缺失造成“安全缺口”,使 Crescendo、ActorAttack 等对抗战术得以让恶意意图缓慢跨轮渗透、绕过无状态过滤器。我们提出 DeepContext,一个旨在刻画用户意图时间轨迹的有状态监控框架。DeepContext 抛弃孤立评估模型,改用循环神经网络(RNN)架构,摄取微调的轮次级嵌入序列。通过在对话中传播隐藏状态,DeepContext 捕获无状态模型忽视的风险增量累积。评估表明,DeepContext 在多轮越狱检测上显著超越现有基线,取得 0.84 的最优 F1 分数,大幅领先云厂商护栏和 Llama-Prompt-Guard-2(0.67)、Granite-Guardian(0.67)等领先开源模型。此外,DeepContext 在 T4 GPU 上保持低于 20 毫秒的推理开销,确保实时应用的可行性。这些结果表明,对意图的序列演化建模,是比部署庞大无状态模型更有效、计算更高效的替代方案。

DeepContext:LLM 多轮对抗意图漂移的有状态实时检测
图1:DeepContext架构。该流水线由三个主要阶段组成:(1)使用微调BERT与任务特定加权池化进行轮次级嵌入提取;(2)通过GRU进行循环意图跟踪以维持对话状态;(3)带混合残差连接的轨迹分类器用于最终安全评分。