论文

STAGE-Claw:面向真实场景的基于状态的自动智能体基准构建

STAGE-Claw: Automated State-based Agent Benchmarking for Realistic Scenarios

智能体系统Agent任务评测

摘要

大型语言模型越来越多地用于为日常应用程序的个人代理提供支持,但评估这些代理仍然是一个挑战。现有的基准仍然依赖于沙盒工件、静态任务设计和粗略评分,这阻碍了可扩展性并限制了可靠个人代理评估的进展。本文介绍了 STAGE-Claw,这是一个自动化框架,用于在基于状态的个人计算环境中构建和评估真实的个人代理场景。给定任务提示,STAGE-Claw 会自动创建并验证真实的基准任务及其环境、任务提示、基本事实和相关验证程序。然后在现实的操作环境中评估代理,其中性能是通过最终系统状态的正确性而不是仅通过文本响应来衡量的。本文使用 STAGE-Claw 创建了包含 40 个具有挑战性的真实场景代理任务的基准,评估了 11 个前沿模型,并分析了它们的任务得分、成本、工具调用可靠性和常见故障模式。总体而言,STAGE-Claw 提供了一种可扩展的、基于状态的方法来评估现实用户场景中的代理。

STAGE-Claw:面向真实场景的基于状态的自动智能体基准构建:论文配图
图 1:STAGE-Claw 的工作流程。 1) 基准创作:探索任务提示并生成任务。 2)基准验证:检查任务的正确性、难度和再现性,必要时进行修改。 3)代理执行:目标代理尝试在环境中执行任务。 4)基于状态的评估:通过验证系统状态对结果进行评分。