论文

SafeCoEvo:LLM Agent在测试时共同进化的安全带和防护装置

SafeCoEvo: Co-Evolving Safety Harnesses and Guards for LLM Agents at Test-Time

智能体系统Agent Harness智能体自我改进

摘要

部署在现实环境中的LLMAgent不断遇到新的任务和安全风险,而执行反馈通常只有在每个任务完成后才可用。然而,现有的自我进化方法通常依赖于对固定且可重复访问的任务分布进行多轮优化,这与现实部署中的测试时适应有根本不同,在现实部署中,只有从过去的任务中积累的经验才能用于改进未来未见任务的安全决策。为了解决这一限制,我们提出了 SafeCoEvo,这是一种用于 LLM Agent安全的测试时 Harness-Guard 协同进化框架,使外部安全系统能够不断适应积累的运行时经验。 SafeCoEvo 在不同的时间尺度上共同提高了两种互补的安全能力:S-Harness 快速将最近的运行时经验外化为可更新的显式安全知识,可以及时影响后续任务,而 GuardVPO 将较长时间尺度上积累的运行时安全经验内化为参数化风险判断能力。 SafeCoEvo将短期快速适应与长期能力巩固相结合,不断提升智能体的安全能力,较最强基线将不安全结果率降低10.05%,同时将任务成功率提高12.15%,实现安全性和任务效用的同步提升。