论文
不要声称面向基准的优化可以提高通用编码能力——需要多样化的评估
Don't Claim Benchmark-Oriented Optimization Improves General Coding Capability -- Diverse Evaluation Is Required
摘要
后训练 论文、模型卡和博客文章通常将一小组编码基准(例如 SWE-bench 和 LiveCodeBench)的分数视为广泛编码能力的证据,无论是研究工件还是面向用户的系统。我们认为,对这些基准的优化会导致测量特定于任务的性能,从而在测量的分数和一般编码能力的声明之间产生有意义的差距。我们使用我们创建的基于 Django 的案例研究基准套件来检查这一差距。评估在 SWE 基准轨迹上训练后的基础模型和检查点,我们发现基准排名经常无法概括。训练后的检查点显示出很少的跨任务传输,并且 SWE 基准优化对我们的任务或 LiveCodeBench 产生的收益有限或没有收益。同样,单个 Django 模式上的 微调 也无法传输。我们的结论是,少量的基准不足以在基准优化压力下评估不同的模型。我们鼓励社区使用差异化评估——针对前沿模型的整体评估、针对研究的多任务套件以及针对狭窄任务应用的人机循环研究。最后,我们主张创建一种能力分类法和持续的基准维护,而不是一次性的基准发布。如果没有可靠的评估标准,使用 LLM 的工程师和研究人员以及代理商必须依靠不充分的证据来做出研究、开发和部署决策。