论文
LiveAgentBench:跨 104 个现实挑战的 Agentic 系统综合基准
LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges
摘要
随着大语言模型能力增强,通用 AI 智能体在实际应用中日益普遍。然而现有基准存在显著局限,无法准确代表现实用户任务。为弥合这一差距,我们提出 LiveAgentBench,一个包含反映真实用户需求的 104 个场景的综合基准。它由社交媒体和现实产品中公开征集的问题构建。我们方法的核心是社交感知驱动数据生成(SPDG),这一新流程确保每个问题的现实相关性、任务复杂度和结果可验证性。我们用 LiveAgentBench 评估多种模型、框架和商业产品,揭示其实际表现并指出改进空间。本次发布含 374 个任务,其中 125 个用于验证、249 个用于测试。SPDG 流程支持用来自现实交互的新查询持续更新。
