论文

OmniaBench:跨不同场景对通用人工智能代理进行基准测试

OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

智能体系统Agent任务评测

摘要

大语言模型 逐渐从文本生成器发展成为能够理解用户请求、调用外部工具并通过交互完成复杂任务的通用代理。然而,现有的代理基准测试通常关注有限的场景、工具生态系统或交互格式,因此很难系统地表征跨异构应用程序设置的模型功能。我们引入 OmniaBench,这是一个用于评估具有显式状态空间的不同场景的通用代理的基准。我们从应用商店、产品文档、行业资源、Web检索和人工提炼中获取面向应用的场景知识,形成跨越ToC、ToB和ToE、90个一级域和354个二级域的分层分类法。基于这种分类法,我们构建了可执行环境,并通过四个互补的途径综合单轮和多轮任务:DAG、DAG-S、Solver 和 Program。 OmniaBench 进一步引入了十维能力分类法和八个组成原子难度因子,以支持细粒度的评估和分析。生成的数据集包含 1,431 个任务,以及 644 个任务的具有挑战性的子集,旨在降低评估成本并减轻公开发布后全套任务的潜在污染。该工作台对当前的前沿模型提出了巨大的挑战,甚至 Claude-Sonnet-5 和 GPT-5.6-Sol 的总体 Pass@1 分数也分别仅为 58.54 和 57.14。进一步的分析揭示了不同领域和能力之间的明显差异,以及规划、约束维护和自适应校正方面持续存在的局限性。 OmniaBench 提供了广泛的诊断基准来表征一般代理的能力边界。