论文

BenchEvolver:通过以解决方案为中心的进化进行前沿任务综合

BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution

模型评测基准与评测资源

摘要

前沿 大语言模型 的快速进展导致基准测试普遍饱和,限制了现有数据集区分模型能力或提供有用训练信号的能力。例如,在 LiveCodeBench 上,前沿模型在简单分割上的通过率超过 99%,在不同难度级别的平均通过率超过 90%。构建新的、具有挑战性的数据集通常需要大量的人力,从而造成了进展的瓶颈。我们引入了 BenchEvolver,这是一个以解决方案为中心的进化框架,可以自动将现有的编码问题转化为更难的变体。 BenchEvolver 不是从头开始生成问题,而是通过结构化转换来演化参考解决方案,并从演化的解决方案中导出相应的语句和测试。这种设计以可执行语义为基础,能够以可验证的正确性实现高质量、多样化和困难任务的可扩展构建。将 BenchEvolver 应用于 LiveCodeBench 和 SciCode,我们获得了更加困难的进化任务,同时保持了有效性、参考正确性和多样性。我们进一步策划了 LiveCodeBench-Plus,这是一个包含 91 个问题的基准测试,结合了进化的和困难的原始 LCB-v6 任务,其中前沿模型 Pass@1 的范围从 27.5% 到 62.6%,恢复了强编码模型之间的清晰区分。重要的是,即使对于生成这些任务的模型来说,进化的任务仍然具有挑战性,从而实现自我改进。我们进一步表明,进化 LCB 任务上的 RL 提高了保留编码性能:对于 gpt-oss-20b,种子+进化训练在 LCB v6 Hard 和 LCB-Pro Easy 上实现了 +8.7 和 +8.3 Pass@1 增益,分别超过仅种子增益 70.7% 和 34.8%。我们的结果表明,BenchEvolver 可以将饱和基准转换为前沿级评估套件和可重复使用的训练信号。