论文
AgentSLABench:资源约束下Agentic系统的评估基准
AgentSLABench: Evaluating and Benchmarking Agentic Systems Under Resource Constraints
摘要
我们提出了一种资源感知的评估框架AgentSLABench,用于自主AI代理,该框架在声明资源预算下测量正确性、延迟、成本、计算资源、内存资源和网络资源的使用。与标准基准相比,AgentSLABench不仅报告准确率,还生成每个代理在每个任务上的多维性能报告,类似于系统性能分析工具(perf、pprof、cProfile)测量代码资源消耗,但扩展了任务正确性作为首要维度。AgentSLABench提供16个任务环境,覆盖6个类别(5个核心:多跳问答、零售替换、代码生成、网络购物、旅行规划;11个扩展)的任务环境,使用隔离的Docker容器、声明的CPU/内存/时间/网络预算、密封的测试集(SHA256哈希)和标准化的性能分析协议。我们对5个通用基准代理(ReAct、PlanAndSolve、Reflexion、CoT、随机)以及4个任务专用代理进行了性能评估,发现任务专用代理在五个核心任务中的三个(事实问答、网络购物、旅行规划)上达到100%的成功率,而在零售和代码生成任务上达到66.7-83.3%的成功率,而通用基准代理在五个领域任务中的四个上完全失败。关键在于,我们报告了效率调整后的成功率(EASR)——成功率根据资源消耗相对于声明的预算进行加权——揭示高成本下的准确率不是生产可用的。我们公开了完整的基础设施、密封的测试集和性能分析结果,以便进行可重复的、资源感知的代理评估。