论文

WildClawBench:真实世界、长期代理评估的基准

WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

智能体系统Agent任务评测

摘要

大型语言和视觉语言模型越来越多地为通过命令行界面 (CLI) 代表用户行事的代理提供支持。然而,大多数代理基准测试仍然依赖于合成沙箱、短期任务、模拟服务 API 和最终答案检查,这使得代理是否可以在部署的运行时完成实际的长期工作尚不确定。这项工作提出了 WildClawBench,这是一个本机运行时基准,包含 60 个人类编写的、双语的、多模式的任务,涵盖六个主题类别。每个任务平均需要大约 8 分钟的挂钟时间和 20 多个工具调用,并在托管实际 CLI 代理工具(OpenClaw、Claude Code、Codex 或 Hermes Agent)的可重复 Docker 容器内运行,可以访问真实工具而不是模拟服务。分级是混合的,结合了基于确定性规则的检查、副作用的环境状态审核以及用于语义验证的 LLM/VLM 判断。在 19 个前沿模型中,最好的 Claude Opus 4.7 在 OpenClaw 下总体仅达到 62.2%,而其他所有模型都保持在 60% 以下,仅切换Harness就可以使单个模型移动多达 18 个点。这些结果表明,对于当前前沿模型而言,长期的、本机运行时代理评估仍然是一个远未解决的任务。我们发布任务、代码和容器化工具来支持可重复的评估。