论文

TensorBench:在基于编译器的张量框架上对 编码智能体 进行基准测试

TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework

模型评测基准与评测资源

摘要

存储库级编码基准面临任务难度和评估可靠性之间的权衡:挑战前沿模型的任务通常涉及测试覆盖率不完整的大型代码库,而人工审查则无法扩展。我们推出 TensorBench,它是基于开源编译器的张量框架上 199 个功能添加和重构任务的基准测试,该框架通过对密集和稀疏张量的一流支持扩展了 PyTorch。任务涵盖新的稀疏格式、密集优化通道、IR 转换、调度程序更改、运行时组件和高级数值运算符。 TensorBench 通过应用代理的补丁并运行框架的测试套件来对每次运行进行评分,其中包括预先存在的随机回归测试和代理添加的任何测试。对于功能添加任务,通过意味着修补后的存储库保留已测试的预先存在的行为,并满足代理添加的对所请求功能的检查。我们评估了涵盖三个前沿模型系列和一个开放权重模型的七个 编码智能体。此标准下的通过率范围从最强代理的 $64.8\%$ 到最弱代理的 $22.1\%$。代理传递不同的任务子集:成对 Cohen 的 $κ$ 范围从 $-0.07$ 到 $0.43$,其中两个最强代理的 $κ= 0.05$。