论文
AgentSpy:从智能体外部观察AI智能体的实际行为
AgentSpy: Making AI Agent Behavior Observable
摘要
基于大语言模型(LLM)的AI智能体会运行shell命令、读写文件并访问网络,通常拥有用户的权限。但执行过程中智能体究竟做了什么很难理解:测试断言针对结果,智能体轨迹只记录智能体自己报告的行为,可能漏掉由其子进程执行的行为。我们提出AgentSpy,从智能体外部观察智能体。AgentSpy根据声明式规范配置隔离环境,在其中运行智能体,并记录智能体及其启动的每一个进程的系统调用与网络流量。在此监控基础上,AgentSpy支持两类分析:一致性分析测量义务,即一次执行应当做什么;安全性分析检查禁止事项,即一次执行绝不能做什么。我们分别实现了这两类中的一种分析。可靠性分析通过规则,以使用的环境资源概括每次运行,包括执行的命令、访问的文件及联系的主机。安全性分析对一次执行的系统调用应用确定性规则。在可靠性评估中,我们使用Codex Harness和三个近期LLM完成77项任务,每项重复三次。在92.2%的比较中,同一任务重复运行的集合,比包含其他任务运行的集合更相似。对于三次运行都通过结果测试的任务,智能体在18%的情况下进行与任务无关的活动,在7%的情况下读取评分文件,在17%的情况下不使用开发者指导。在安全性方面,AgentSpy的通用规则检测出所考察五类攻击中的四类,在50次运行中没有误报。