论文

SlopCodeBench:对 编码智能体 在长期迭代任务中如何降级进行基准测试

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

智能体系统Agent任务评测

摘要

软件开发是迭代的,但代理编码基准通过其单次设置隐藏了设计问题。最近的迭代基准测试试图解决这个问题,但严重限制了代理的设计决策空间,使得无法忠实地衡量他们的决策如何塑造未来的扩展。我们引入了 SlopCodeBench,这是一个包含 36 个问题和 196 个检查点的基准,代理在其中反复扩展自己的解决方案。与之前的迭代基准不同,我们不断发展的规范需要架构决策,但将内部结构留给代理。我们测量两种形式的退化:结构侵蚀(集中的复杂性)和冗长(冗余代码)。跨开放和封闭模型评估 15 编码智能体,我们发现没有代理能够完全端到端地解决任何问题,并且最好的代理通过了 14.8% 的检查点。各个检查点的质量都会下降,77% 的轨迹出现结构性侵蚀,75.5% 的轨迹变得冗长。与 473 个开源 Python 存储库相比,代理代码的冗长程度高出 2.3 倍,腐蚀程度高出 2.0 倍,而人类存储库在其 git 历史记录中降级的频率更低,降级幅度更小。明确的质量指导可将初始的冗长和侵蚀减少多达三分之一,而不影响降解率。 SlopCodeBench 提供了迭代扩展下代码退化的第一个测量,揭示了代理在通过检查点的同时生成的代码在每轮中都会被侵蚀和膨胀。