论文
锯齿状的边界:评估代码智能体对语义保持变换的鲁棒性
A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations
摘要
AI代码智能体正被越来越多地部署用于解决真实软件问题,但它们在表面的代码变体下的可靠性仍知之甚少。我们评估修复仓库级问题的编码智能体,在周边代码库被重写为语义等价形式后是否仍然可靠。我们引入一个随机变体采样器,对代码应用常见的语义保持变换(SPT)——涵盖控制流重写、死代码注入和标识符重命名——生成扰动变体。我们评估两个智能体脚手架(mini-SWE agent和OpenCode),每个分别由四个前沿模型(Claude Opus 4.5、Kimi K2.5、MiniMax M2.5和Qwen 3.6-27B)之一驱动,实例来自SWE-bench Verified和SWE-bench Pro。对每个实例,智能体在未扰动与扰动变体上各运行多次,得到配对的解决率估计,从而把扰动效应与内在随机性分离。我们发现大多数配置下只有小幅退化:受影响最大的配置中平均解决率最多下降6.7个百分点,16个模型-脚手架-数据集配置中有6个出现统计显著的退化。关键的是,没有任何单一模型的鲁棒性排名能跨脚手架保持——Qwen在mini-SWE agent下的SWE-bench Verified上属于最鲁棒之列,而在OpenCode下却最脆弱——揭示出锯齿状的鲁棒性边界。更简单的脚手架(mini-SWE agent)对扰动更鲁棒。我们的结果表明,即便顶级前沿模型也易受语义保持扰动影响,尽管效应并不均匀,这引发了对AI代码智能体在多样真实代码库中部署可靠性的担忧。
