论文

ACE-Bench:轻量级环境下具有可扩展视野和可控难度的代理可配置评估

ACE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments

智能体系统Agent任务评测

摘要

现有智能体基准存在两个关键局限:环境交互开销高(最高可达总评估时间的41%),以及任务时域与难度分布不均衡,使汇总分数不可靠。为解决这些问题,我们提出AgentCE-Bench,它围绕统一的基于网格的规划任务构建:智能体必须在局部槽位约束与全局约束下,填充一个部分完成的日程表中的隐藏槽位。该基准通过两个正交轴提供细粒度控制:可扩展时域(Scalable Horizons),由隐藏槽位数量H控制;可控难度(Controllable Difficulty),由诱饵预算B支配,其决定全局误导性诱饵候选的数量。关键在于,在轻量环境(Lightweight Environment)设计下,所有工具调用均通过静态JSON文件解析,消除了环境搭建开销,实现快速、可复现、适合训练期验证的评估。我们首先验证H与B能可靠地控制任务时域与难度,且AgentCE-Bench具有良好的领域一致性与模型区分度。随后我们在6个领域上对13个不同规模与家族的模型开展全面实验,揭示了显著的跨模型性能差异,并确认AgentCE-Bench能为智能体推理提供可解释、可控的评估。

ACE-Bench:轻量级环境下具有可扩展视野和可控难度的代理可配置评估
图 3:ACE-Bench 框架概述。左(数据示例):每个任务由两个可配置轴控制 - 隐藏槽 ( H H ) 和诱饵预算 ( B B )。每个隐藏槽都有一个候选池,其中包含一个真值(绿色)、违反槽约束的过滤候选(红色)以及通过槽约束但导致全局冲突的诱饵候选(橙色)。右(交互):代理在基于 JSON 的轻量级环境中运行,通过多轮工具使用对话迭代查询和填充隐藏槽,从而能够跨可配置的难度级别精确测量代理能力。