论文

锯齿状的边界:评估代码智能体对语义保持变换的鲁棒性

A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations

模型评测智能体系统Agent HarnessAgent任务评测鲁棒性、公平性与可信度评测长程任务评测

摘要

AI代码智能体正被越来越多地部署用于解决真实软件问题,但它们在表面的代码变体下的可靠性仍知之甚少。我们评估修复仓库级问题的编码智能体,在周边代码库被重写为语义等价形式后是否仍然可靠。我们引入一个随机变体采样器,对代码应用常见的语义保持变换(SPT)——涵盖控制流重写、死代码注入和标识符重命名——生成扰动变体。我们评估两个智能体脚手架(mini-SWE agent和OpenCode),每个分别由四个前沿模型(Claude Opus 4.5、Kimi K2.5、MiniMax M2.5和Qwen 3.6-27B)之一驱动,实例来自SWE-bench Verified和SWE-bench Pro。对每个实例,智能体在未扰动与扰动变体上各运行多次,得到配对的解决率估计,从而把扰动效应与内在随机性分离。我们发现大多数配置下只有小幅退化:受影响最大的配置中平均解决率最多下降6.7个百分点,16个模型-脚手架-数据集配置中有6个出现统计显著的退化。关键的是,没有任何单一模型的鲁棒性排名能跨脚手架保持——Qwen在mini-SWE agent下的SWE-bench Verified上属于最鲁棒之列,而在OpenCode下却最脆弱——揭示出锯齿状的鲁棒性边界。更简单的脚手架(mini-SWE agent)对扰动更鲁棒。我们的结果表明,即便顶级前沿模型也易受语义保持扰动影响,尽管效应并不均匀,这引发了对AI代码智能体在多样真实代码库中部署可靠性的担忧。

锯齿状的边界:评估代码智能体对语义保持变换的鲁棒性:论文配图
图1:两种基准上每个模型在每种脚手架(scaffold)下的平均退化Δ̄(百分点)。误差条为固定总体的95% bootstrap置信区间。