论文

对通用LLM智能体的测试时扩展进行基准测试

Benchmark Test-Time Scaling of General LLM Agents

智能体系统Agent任务评测

摘要

LLM智能体日益被期望成为能处理开放式用户请求的通用系统。现有基准聚焦于培育专用智能体的领域化环境,而评估通用智能体需要更现实的设定,在统一环境中挑战其跨多种技能与工具运作。我们提出General AgentBench,一个为在搜索、编码、推理与工具使用等领域评估通用LLM智能体提供统一框架的基准。借助General AgentBench,我们系统研究串行扩展(迭代交互)与并行扩展(采样多条轨迹)下的测试时扩展行为。对十个领先LLM智能体的评估显示,从领域专用评估转入该通用智能体设定后性能大幅下降。此外我们发现,实践中两种扩展方法均未带来有效性能提升,原因在于两个根本局限:串行扩展的上下文天花板与并行扩展的验证缺口。代码已公开于 https://github.com/cxcscmu/General-AgentBench。

对通用LLM智能体的测试时扩展进行基准测试
图2:展示General AgentBench如何覆盖广泛的任务类别、同时提供统一界面以模拟真实世界用户交互的示意。绿色区域表示智能体当前正在处理的特定任务(例如搜索任务)。橙色方框表示其他保持活跃并可响应、但不直接参与当前交互的客户端与服务器。红色表示其他领域专属数据被排除在外。