论文

治理衰减:上下文压缩如何静默抹除长程LLM智能体中的安全约束

Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents

模型评测上下文与知识上下文工程安全与风险评测

摘要

现代 LLM 代理越来越依赖上下文压缩、摘要或驱逐来将长时间运行的会话保持在词元预算内。我们表明,这个上下文管理层是一个安全关键的故障表面:代理在可见时可靠遵守的上下文治理约束可以通过压缩悄然删除,从而导致同一代理在会话稍后执行禁止的工具操作。我们将这种失败模式称为“治理衰退”。我们引入了 ConstraintRot,它是具有确定性工具调用分级的长视野代理场景的基准,并测量七个模型系列中由压缩引起的违规。在 1,323 集中,违规率从完整上下文中策略的 0% 上升到压缩后的 30%,某些模型达到 59%;当约束在摘要中幸存下来时,违规率仍为 0%,但当它被删除时,违规率达到 38%。我们进一步研究了压缩驱逐攻击,其中对抗性上下文内容使摘要器产生偏见,从而忽略合法​​策略,并表明优化注入击败了每个评估的模型。最后,我们提出了 Constraint Pinning,这是一种简单的免训练缓解措施,可以隔离有损压缩的治理约束,并将基准中的违规率恢复到 0%。这些结果表明上下文管理是部署的 LLM 代理的一流治理界面。