论文

代码语言模型遵循测试吗?对程序行为的配对干预

Do Code Language Models Follow Tests? Paired Interventions on Program Behavior

模型评测评测方法与指标

摘要

可见的测试指定了具体的程序行为,但基准准确性的提高并不能证明模型遵循这些测试所表达的规则。我们通过匹配的提示控制、配对的语义干预和通过故障检测选择的测试套件来研究测试利用率。我们的语义干预保留未指定的描述,其示例输入固定,同时更改正确的输出以表达两个有效规则之一。对未见输入的评估衡量两个生成的程序是否遵循各自的规则。在 20 个规格系列的 5 个模型和 3 个运行 120 个配对实例中,平均切换率范围为 11.1\% 到 65.8\%。 Qwen3.8-27B 的点估计值最高,其次是 Qwen3.6-27B,为 60.6%;他们的配对差异仍然不确定。显式描述在每个实例上从这两个模型中引出这两个规则,暴露了实现能力和测试指定规则的采用之间的差距。对于所有五个模型,正确的预期输出可以提高 MBPP+ 的准确性,而不仅仅是输入。在使用固定三测试套件的 180 项任务中,高检测套件在以参考突变体为主的保留池中检测到的错误增加了 30.3 个百分点。相应的代际差异范围从$-0.6$到$+1.1$点;所有间隔都包括零并与某些好处保持兼容。配对干预使得测试指定的规则更改可以与实施能力和基准正确性一起衡量。