论文
精确调试基准:您的模型是在调试还是在重新生成?
Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?
摘要
与代码完成不同,调试需要定位错误并应用有针对性的编辑。我们观察到前沿 LLM 在调试过程中经常重新生成正确但过度编辑的解决方案。为了评估 LLM 距离精确调试有多远,我们引入了精确调试基准(PDB)框架,该框架可自动将任何编码数据集转换为具有精度感知评估的调试基准。 PDB 通过综合经过验证的原子错误并将其组合成多错误程序来生成有错误的程序。我们定义了两个新颖的指标:编辑级精度和错误级召回率,它们衡量进行了多少必要的编辑以及解决了多少错误。我们发布了两个评估基准:针对单行错误的 PDB-Single-Hard 和针对多行错误的 PDB-Multi。实验表明,GPT-5.1-Codex 和 DeepSeek-V3.2-Thinking 等前沿模型的单元测试通过率高于 76%,但精度低于 45%,即使明确指示执行最少的调试也是如此。最后,我们表明迭代和代理调试策略并不能显着提高精确度或召回率,这突出表明需要重新考虑编码模型的 后训练 管道。