论文
Claw-SWE-Bench:评估 OpenClaw 式代理工具在编码任务上的基准
Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks
摘要
通用代理工具的软件工程能力仍未得到充分开发,现有基准测试为在一致条件下比较这些工具提供了有限的支持。为了弥补这一差距,我们引入了 Claw-SWE-Bench,这是一个统一的基准,使研究人员能够系统地评估通用工具在软件工程任务上的能力和效率。该基准测试包含跨 8 种编程语言和 43 个存储库的 350 个真实 GitHub 问题解决实例,并提供共享适配器协议来跨Harness调整任务输入、输出和执行环境。实验表明,通用用途的工具可以有效地解决现实世界的软件问题,并且即使底层模型保持固定,它们的成功率和资源消耗也有很大差异。为了降低评估成本并支持更快的调试和迭代,我们还提供了 Claw-SWE-Bench Lite,这是一个包含 80 个实例的子集,旨在保留完整基准测试的关键评估属性。我们希望这个基准测试能够帮助研究人员更好地评估和了解通用用途Harness在软件工程任务上的性能,并指导开发更强大、更高效的Harness。数据可在 https://github.com/opensquilla/claw-swe-bench 和 https://huggingface.co/datasets/TokenRhythm/Claw-SWE-Bench 获取。