论文

RealClawBench:来自真实开发人员代理会话的实时 OpenClaw 基准测试

RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

模型评测基准与评测资源

摘要

代理基准测试应反映用户实际要求部署的代理执行的操作,但现有基准测试通常会错过真实开发人员代理会话的关键现实属性。我们引入 RealClawBench,这是一个基于真实 OpenClaw 会话构建的实时基准框架,用于捕获已部署代理使用的分布、多样性和实际难度。真实的用户请求很难进行基准测试,因为它们通常依赖于本地执行环境,涉及隐式或未指定的意图,并且需要重要的验证。 RealClawBench 通过两个核心机制解决了这些挑战:重建的执行环境和确定性的可验证评分器,它们共同将真实会话转换为可重复的自动评分任务。生成的版本包含从更大的实际会话池中采样的 281 个可执行任务,同时保留源分布,最大最终与源 Jensen-Shannon 散度为 0.0448。对 14 个当代模型的评估表明,最好的系统只能解决 65.8% 的任务,揭示了实际开发人员代理工作负载的巨大空间。通过将真实部署的会话转变为受控评估实例,RealClawBench 提供了一条实用的基准测试路径,可以更好地衡量实际使用中的代理能力。代码位于:https://anonymous.4open.science/r/real-claw-bench-582B。