论文

UniClawBench:主动代理实际任务的通用基准

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

智能体系统Agent任务评测

摘要

大语言模型 和多模式 大语言模型 的快速发展加速了能够操作日常工具并在现实环境中为用户提供帮助的主动代理的出现。然而,现有的基准很难有效地评估此类代理,因为它们通常依赖于沙盒环境和单轮评估范例。此外,他们基于场景的任务分类法在同一任务类别中混合了多种模型功能,使得很难确定代理失败的根本原因。为了解决这些限制,我们推出了 UniClawBench,这是第一个能力驱动的基准测试,旨在评估动态、现实环境中的主动代理。 UniClawBench 围绕五种基本模型功能构建:技能使用、探索、长上下文推理、多模式理解和跨平台协调。基于这些能力,我们设计了 400 个双语现实世界任务。与之前依赖静态、预先记录的答案的基准测试不同,我们的基准测试使用细粒度、逐步完成检查点来评估实时 Docker 容器中的代理。此外,我们设计了一种闭环评估策略,包括执行代理、隐藏监督代理和用户代理,以模拟真实的多轮人类反馈,而不会泄露评分标准。为了将基本模型功能与框架级设计选择分开,我们评估了多个代理框架下的最先进模型。通过对模型和框架的全面比较,我们展示了基本模型功能和代理框架设计如何共同塑造现实环境中的性能。为了促进未来的研究,我们在 https://github.com/HKU-MMLab/UniClawBench 上公开提供我们的基准测试和代码。