论文

ClawBench:AI代理能完成日常在线任务吗?

ClawBench: Can AI Agents Complete Everyday Online Tasks?

智能体系统Agent任务评测

摘要

人工智能代理也许能够协助处理电子邮件和文档,但它们能否可靠地完成真实网站上的日常在线工作流程?日常在线任务为评估下一代人工智能代理提供了一个现实但尚未解决的测试平台。为此,我们推出了 ClawBench,这是一个评估框架,包含人们在生活和工作中需要定期完成的 153 项日常在线任务,涵盖 15 个类别的 144 个平台,从完成购买、预约到提交工作申请。这些任务需要超越现有基准的功能,例如从用户提供的文档中获取相关信息,跨不同平台导航多步骤工作流程,以及正确填写许多详细表格等繁重的写入操作。与使用静态页面评估离线沙箱中的代理的现有基准不同,ClawBench 在生产网站上运行,保留了真实网络环境的全部复杂性、动态性质和交互挑战。拦截层捕获并阻止最终提交请求,确保安全评估,不会对现实世界产生副作用。我们对 8 个前沿模型的评估表明,专有模型和开源模型都只完成了这些任务的一小部分。例如,Claude Sonnet 4.6 仅达到 33.3%,这暴露了当前 AI 代理的差距。 ClawBench 的进展让我们更接近可以充当通用助理的人工智能代理。