论文

NAAMSE:智能体进化式安全评估框架

NAAMSE: Framework for Evolutionary Security Evaluation of Agents

模型评测安全与风险评测

摘要

人工智能代理越来越多地部署在生产中,但它们的安全评估仍然受到手动红队或静态基准的瓶颈,无法对自适应、多轮对手进行建模。我们提出了 NAAMSE,一种进化框架,它将代理安全评估重新构建为反馈驱动的优化问题。我们的系统采用单个自主代理来协调基因提示突变、分层语料库探索和不对称行为评分的生命周期。通过使用模型响应作为适应性信号,该框架迭代地复合有效的攻击策略,同时确保“良性使用的正确性”,防止全面拒绝的退化安全性。我们在 Gemini 2.5 Flash 上的实验表明,进化突变系统地放大了一次性方法遗漏的漏洞,受控消融揭示了探索和目标突变之间的协同作用,揭示了高严重性故障模式。我们表明,面对不断变化的威胁,这种自适应方法可以对代理的鲁棒性进行更现实和可扩展的评估。 NAAMSE 的代码是开源的,可从 https://github.com/HASHIRU-AI/NAAMSE 获取。