论文

CocoaBench:在野外评估统一数字代理

CocoaBench: Evaluating Unified Digital Agents in the Wild

智能体系统Agent任务评测

摘要

LLM 代理现在在软件工程、深入研究、GUI 自动化和各种其他应用中表现强劲,而最近的代理支架和模型越来越多地将这些功能集成到统一系统中。然而,大多数评估仍然孤立地测试这些功能,这为需要代理结合不同功能的更多样化的用例留下了空白。我们推出了 CocoaBench,这是一个统一数字代理的基准,它是根据人工设计的长期任务构建的,需要灵活地组合视觉、搜索和编码。任务仅由指令和最终输出的自动评估功能指定,从而实现跨不同代理基础设施的可靠且可扩展的评估。我们还推出了 CocoaAgent,一个轻量级共享支架,用于跨模型主干进行受控比较。实验表明,当前的代理在 CocoaBench 上仍然不够可靠,评估最好的系统仅实现 45.1% 的成功率。我们的分析进一步指出,推理和计划、工具使用和执行以及视觉基础方面还有很大的改进空间。