论文
SmellBench:编码Agent的细粒度重构评测
SmellBench: Towards Fine-Grained Evaluation of Code Agents on Refactoring Tasks
摘要
近年来,代码代理取得了显着的进步,在广泛的软件工程任务中展现了强大的能力。然而,它们的滥用常常会产生臃肿且杂乱的代码,从而损害可读性、可扩展性和健壮性。尽管存在这种风险,现有的基准测试主要评估功能的正确性,而不是代码代理的长期可维护性。在本文中,我们提出了 SmellBench,这是一种可扩展的代码重构基准,可以主动将代码异味注入现实存储库中的干净代码片段中。该设计能够使用人工编写的 真值 生成受控的、高质量的、多样化的重构案例。具体来说,它包含 294 个案例,涵盖 7 个流行的代码异味类型、3 个难度级别、7 个现实存储库的 2 种指令设置。我们进一步设计了功能正确性、问题定位能力和重构质量评估3个评估方面。对 2 个流行代理和 6 个大型语言模型 (LLM) 的实验表明,最佳组合 - Qwen Code + Claude Sonnet 4.5 - 仅获得了 50.34 的代码异味消除得分。进一步分析发现,这种差距是由于对本地代码异味的关注和缺乏跨文件理解而产生的,这阻碍了异味的全面消除。