论文

审核代理安全

Auditing Agent Harness Safety

智能体系统Agent任务评测

摘要

LLM 代理越来越多地在执行工具内运行,这些执行工具调度工具、分配资源以及在专用组件之间路由消息。然而,Harness可以在访问未经授权的资源或将上下文泄露给错误代理的轨迹上返回正确、良性的答案。输出级评估无法看到这些故障,但大多数安全基准仅对最终输出或最终状态进行评分,尽管许多违规发生在轨迹中间而不是终止时。核心问题是该工具在整个执行过程中是否尊重用户意图、权限边界和信息流约束。为了解决这一差距,我们提出了 HarnessAudit,这是一个跨边界合规性、执行保真度和系统稳定性审计完整执行轨迹的框架,重点关注这些风险最明显的多代理利用。我们进一步介绍了 HarnessAudit-Bench,它是跨 8 个现实世界领域的 210 个任务的基准,在具有嵌入式安全约束的单代理和多代理配置中实例化。通过评估前沿模型和三个多智能体框架的十种Harness配置,我们发现:(i)任务完成与安全执行不一致,并且违规行为随着轨迹长度而累积; (ii) 安全风险因领域、任务类型和代理角色而异; ㈢ 大多数违法行为集中在资源获取和机构间信息传输方面; (iv)多主体协作扩大了安全风险面,而Harness设计则设定了安全部署的上限。