论文
DeepContext:LLM 多轮对抗意图漂移的有状态实时检测
DeepContext: Stateful Real-Time Detection of Multi-Turn Adversarial Intent Drift in LLMs
摘要
尽管大语言模型(LLM)能力不断扩展,安全护栏大多仍是无状态的,把多轮对话当作一连串孤立事件处理。这种时序意识的缺失造成“安全缺口”,使 Crescendo、ActorAttack 等对抗战术得以让恶意意图缓慢跨轮渗透、绕过无状态过滤器。我们提出 DeepContext,一个旨在刻画用户意图时间轨迹的有状态监控框架。DeepContext 抛弃孤立评估模型,改用循环神经网络(RNN)架构,摄取微调的轮次级嵌入序列。通过在对话中传播隐藏状态,DeepContext 捕获无状态模型忽视的风险增量累积。评估表明,DeepContext 在多轮越狱检测上显著超越现有基线,取得 0.84 的最优 F1 分数,大幅领先云厂商护栏和 Llama-Prompt-Guard-2(0.67)、Granite-Guardian(0.67)等领先开源模型。此外,DeepContext 在 T4 GPU 上保持低于 20 毫秒的推理开销,确保实时应用的可行性。这些结果表明,对意图的序列演化建模,是比部署庞大无状态模型更有效、计算更高效的替代方案。
