论文
昨日之盾,今日之矛:生产环境中的自进化安全护栏
Yesterday's Shield, Today's Spear: A Self-Evolving Safety Guardrail in Production
摘要
已部署的大语言模型安全护栏大多为静态:训练一次并在发布时冻结,而新的越狱技术与此前未覆盖的有害类别会在数天内出现,使防御永远慢一步。我们提出SESG(自进化安全护栏),一个运行于生产环境的多智能体系统。SESG监控已部署护栏背后的线上流量,并暴露两类失效:形式新颖的越狱与内容新颖的有害类别。一旦确认失效,生成智能体针对其合成配对训练数据;验证智能体将批次向已部署模型出错的方向重新配平,让模型自身的错误引导其训练集;路由智能体将训练动作与诊断出的缺口匹配,并将下一版本送回生产。经过六轮线上进化(V0至V6),1.7B护栏在16-24小时内、约2小时人工投入下适应新威胁,而其取代的手工流程需要40-90小时。在六个新兴威胁上,它优于0.6B至9B的静态护栏和一个自适应基线,同时保持通用筛查能力。自2026年4月起,SESG成为深信服(Sangfor)护栏的主要更新管线,两个月内自主闭环了15个新威胁场景中的14个。我们在https://github.com/Trams1017/SESG发布针对6个新威胁的9个测试集。警告:本文包含可能有害或冒犯性的示例。
