论文

LiveAgentBench:跨 104 个现实挑战的 Agentic 系统综合基准

LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges

智能体系统Agent任务评测

摘要

随着大语言模型能力增强,通用 AI 智能体在实际应用中日益普遍。然而现有基准存在显著局限,无法准确代表现实用户任务。为弥合这一差距,我们提出 LiveAgentBench,一个包含反映真实用户需求的 104 个场景的综合基准。它由社交媒体和现实产品中公开征集的问题构建。我们方法的核心是社交感知驱动数据生成(SPDG),这一新流程确保每个问题的现实相关性、任务复杂度和结果可验证性。我们用 LiveAgentBench 评估多种模型、框架和商业产品,揭示其实际表现并指出改进空间。本次发布含 374 个任务,其中 125 个用于验证、249 个用于测试。SPDG 流程支持用来自现实交互的新查询持续更新。

LiveAgentBench:跨 104 个现实挑战的 Agentic 系统综合基准
图1:LiveAgentBench概览,介绍了从真实用户案例构建评估数据集的过程,并附有LiveAgentBench的汇总结果。"W&S"代表 Work and Study(工作与学习),"DL"代表 Daily Life(日常生活),"IA&P"代表 Information Access and Processing(信息获取与处理),"H&SS"代表 Humanities and Social Science(人文与社会科学),"SP"代表 Social Production(社会生产)。