论文

大语言模型代理能力评估的统一框架

A Unified Framework for the Evaluation of LLM Agentic Capabilities

智能体系统AI 基础设施Agent任务评测SandboxAgent Sandbox

摘要

随着大语言模型越来越多地被部署为代理,对其代理能力的可靠评估变得至关重要。然而,报告的基准分数通常共同反映模型能力和每个基准打包的实现选择,使得交叉基准结果难以解释为底层模型的干净测量。在这项工作中,我们提出了一个统一的框架来公平评估大语言模型代理能力。在统一配置系统的驱动下,该框架将各种基准测试集成为标准化的指令-工具-环境格式,在可控沙箱内通过固定的ReAct式架构执行代理,并提供可选的离线设置,用精选的快照代替不稳定的实时环境,从而可以单独分析框架效果和环境效果。在此基础上,我们统一了每个基准的原始任务成功标准下的评估方法,同时引入了统一的资源消耗指标以及决策和执行级别失败归因的分类法。在此框架内,我们采用了 7 个广泛使用的基准,涵盖单代理、多代理和安全关键场景的 24 个领域,并对 15 个模型的 40 万次部署和 5B token进行了大规模实证分析。结果表明,支架选择和环境波动会在两个方向上实质上改变基准结果,使我们的框架能够将内在的大语言模型能力与框架和环境引起的工件分离开来。我们进一步证明了其作为安全关键领域的安全测试平台的可扩展性。代码和基准可在 https://github.com/whfeLingYu/A-Unified-Framework-for-the-Evaluation-of-LLM-Agentic-Capability、https://huggingface.co/AgentFramework/Unified_Farmework 上找到。

大语言模型代理能力评估的统一框架
图 2:提议的统一框架概述。 (1) 输入和设置将基准标准化为指令、工具和环境三元组,由配置系统驱动以简化部署; (2) Agent Sandbox实例化固定架构来管理隔离基础环境内的交互; (3) 评估方法提供了一个统一的管道来衡量任务完成分数、跟踪效率指标并进行自动故障分析。