AgentAudit:一个开放、可扩展的人工智能体全生命周期信任评估框架
AgentAudit: An Open, Extensible Framework for Full-Lifecycle Trust Evaluation of AI Agents
摘要
现有的评估框架大多只评估AI智能体的一部分,例如任务完成情况(AgentBench)或安全鲁棒性(AgentDojo,ASB),而不是规划、工具选择、工具执行、记忆和推理的完整流程。故障可能发生在任何阶段,但现有的基准很少能确定故障的准确来源。 AgentAudit 从十个能力、基础、安全和行为维度评估整个执行轨迹,即指令完整性、规划器、内存、工具选择、工具调用、工具正确性、对齐、工具忠实性、安全性和执行完整性,并结合行为分类和故障归因,以查明导致观察到的故障的确切阶段。 AgentAudit 可以评估任何基于 LLM 的 AI 智能体,因为它附加到智能体而不是替换它。它只读取记录的执行跟踪,不会干扰智能体的运行方式,因此它对智能体的内部实现没有任何限制。我们在九种能力和对抗性任务中评估了五种语言模型(OpenAI GPT-5、Claude Sonnet 5、Sarvam 105B、Llama 3.3 70B 和 Gemini 2.5 Flash)。 Claude Sonnet 5 和 GPT-5 获得了最高的平均综合信任分数(分别为 95.1 和 80.6(满分 100)),而 Sarvam 105B、Llama 3.3 70B 和 Gemini 2.5 Flash 大幅落后(57.6、45.7 和 22.6)。所有痕迹均由单个固定判断模型进行评分,该模型本身就是评估模型之一,这是第 VII.E 节中讨论的局限性。更重要的是,具有相似任务完成行为的模型在可信度方面可能会出现巨大差异,因为一些非前沿模型在对抗性任务上反复被分类为 Unsafe_Compliance 而不是仅仅失败,这是通过/失败基准无法显现的区别。