论文

腾讯WorkBuddy Bench:具有抗污染任务构建的多域编码代理基准测试

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

智能体系统Agent任务评测

摘要

我们推出了编码智能体的多领域评估套件Tencent WorkBuddy Bench;该报告记录了其构建方法、评分协议和跨模型排行榜。其核心是一个统一的评估框架,用于跨四个工作领域(代码、Web、Office 和安全)构建和运行分布通知的编码代理任务。每个任务不是采用公共问题文本,而是从真实的提交、拉取请求或业务场景进行逆向工程,并重写为简短的、口语的、角色扮演的请求,因此任务的提示无法通过网络搜索底层问题、拉取请求或提交线程来恢复。由于数据集是公开发布的(任务目录、环境图像、评估工具、测试和参考解决方案),因此抗污染性取决于此结构以及数据集版本控制,而不是保密。这四个子集——存储库级工程、前端开发、办公室和业务工作流程以及红/蓝队安全——探索实际工作的互补方面,每个子集都有自己的验证风格。所有这些都以统一的任务目录格式打包,并在统一且可重复的协议下在两个代理工具(CodeBuddy Code 和 Claude Code)上运行;完整的开放版本使基准测试可端到端地重现并可直接审核,因为任何第三方都可以重新运行每个任务并检查其内容。由于每个子集使用不同的评分工具,因此子集之间的分数不可比较,并且套件不会报告套件范围内的平均值。我们报告了多个模型系列的跨模型排行榜。