论文
基于失败轨迹的智能体安全对齐同策略自进化
On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment
摘要
使用工具的LLM智能体是通过轨迹而非仅通过最终回复而失败的:它们可能执行不安全的工具调用、遵循注入指令、顺从有害请求,或在产生看似安全的回答的同时过度拒绝良性任务。现有的安全对齐信号大多是回复层面或离策的,且常带来安全-效用权衡:提升智能体安全性以任务性能下降为代价。这种稀疏且单一目标的奖励严重限制了现实可用性。为弥合这一差距,我们提出FATE,一种在策自进化框架,无需专家演示即可将验证器评分的失败转化为修复监督。对于每个失败,同一策略提出修复候选,随后由验证器重新打分,并按安全性、效用、过度拒绝控制和轨迹有效性进行过滤。这一稠密的轨迹级信息随后被用作智能体自进化的监督信号。在此过程中,我们进一步提出Pareto前沿策略优化(PFPO),将监督预热与Pareto感知的策略优化相结合,以维持安全-效用权衡。在AgentDojo、AgentHarm和ATBench上的实验表明,FATE在不同模型和规模上都能提升安全性,同时保留有用行为。与强基线相比,FATE将攻击成功率降低33.5%,有害顺从降低82.6%,并将外部轨迹安全诊断提升6.5%。这些结果表明,失败轨迹可以为更安全的自进化智能体提供结构化的修复监督。
