论文
StepGuard:通过可扩展监督与安全-效用平衡学习步骤级护栏
StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing
摘要
基于LLM的智能体可以通过工具调用与外部环境交互,但这一能力也引入了文件修改、信息泄露与未授权操作等安全风险。现有护栏往往评估已完成的轨迹,对步骤级动作的执行前监测研究不足。我们提出StepGuard,一个步骤级护栏模型,既可以审计已完成的智能体轨迹,也可以在工具动作执行前进行检查。为训练StepGuard,我们提出StepGen,一个自动数据引擎,生成上下文相同但在风险步骤动作不同的安全与不安全轨迹。为进一步减少过度防御与防御不足,我们提出Balance-GRPO,根据观察到的准确率动态平衡安全与不安全动作的学习。实验表明,StepGuard在开放权重护栏模型中取得最高平均准确率,性能与GPT-5.4相当。在AgentDojo与AgentDyn上为智能体提供防护时,StepGuard使平均攻击成功率较无护栏设置降低77.3%,而平均效用仅下降2.8个百分点。
