RuBench:具有本地编写的俄语任务规范的存储库级代理编码基准
RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications
摘要
开发人员越来越多地将真正的维护工作委托给产品级 编码智能体,并且许多任务以客户请求的方式(而不是策划的英语问题)用其母语来陈述。我们引入了 RuBench 1.0,这是从五个实时开源存储库(aiohttp、aiogram、Laravel、NestJS、Fastify)中最近的修复提交中挖掘的 25 个任务的基准,每个任务都是用俄语本地指定的——从头开始编写,没有翻译——并通过上游维护者的回归测试进行判断,我们暂不发布这些测试。所有修复提交均晚于每个评估模型的训练数据截止日期。第 1 轮使用 Opus 4.8、Sonnet 5 和 Haiku 4.5 评估 Claude Code,以及使用 GPT-5.5 的 Codex CLI(每个独立运行 3 次;pass@1 具有任务级不确定性);最佳配置可以解决 78.7% 的任务。审核 hors-concous 配置(Claude Code + Fable 5)的完整轨迹后,我们发现该产品通过官方安全保障回退悄悄地替换了 20% 任务的模型,这证明部署的产品,而不是模型,才是实际测量的单位。版本 2 增加了第 2 轮:在每个配置新鲜度门下的同一个冻结集上的七个进一步配置 - 俄罗斯市场代理 SourceCraft CLI(ds,legacy)和 Koda CLI(koda-pro),带有 Gemini 3.1 Pro 和 3.5 Flash 的 Antigravity,以及带有 GPT-5.6 Sol 和 Luna 的 Codex CLI。 SourceCraft 的旗舰产品分辨率为 68.1% (N=23),高于 GPT-5.5 和 Gemini 行。对所有 437 个第 2 轮轨迹的工具调用污染重新审核发现,Russian 和 Gemini 列是干净的(0/293 个单元),同时标记了 GPT-5.6 系列(8/69 和 13/75 个单元)中的系统性 Oracle 搜索,包括从运行机器磁盘中挖掘前一轮工件的情况;诚实的分数与原始分数一起发布。我们发布声明、元数据、轨迹和差异;预言机通过 SHA-256 清单保留。