论文
ACE-Bench:轻量级环境下具有可扩展视野和可控难度的代理可配置评估
ACE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments
摘要
现有智能体基准存在两个关键局限:环境交互开销高(最高可达总评估时间的41%),以及任务时域与难度分布不均衡,使汇总分数不可靠。为解决这些问题,我们提出AgentCE-Bench,它围绕统一的基于网格的规划任务构建:智能体必须在局部槽位约束与全局约束下,填充一个部分完成的日程表中的隐藏槽位。该基准通过两个正交轴提供细粒度控制:可扩展时域(Scalable Horizons),由隐藏槽位数量H控制;可控难度(Controllable Difficulty),由诱饵预算B支配,其决定全局误导性诱饵候选的数量。关键在于,在轻量环境(Lightweight Environment)设计下,所有工具调用均通过静态JSON文件解析,消除了环境搭建开销,实现快速、可复现、适合训练期验证的评估。我们首先验证H与B能可靠地控制任务时域与难度,且AgentCE-Bench具有良好的领域一致性与模型区分度。随后我们在6个领域上对13个不同规模与家族的模型开展全面实验,揭示了显著的跨模型性能差异,并确认AgentCE-Bench能为智能体推理提供可解释、可控的评估。
