论文
SciCodePile:用于挑战科学代码生成的 128GB 语料库和可执行基准
SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation
摘要
大语言模型 (LLM) 擅长通用代码生成,但它们处理科学代码的效果如何仍然是一个悬而未决的问题。现有数据集和基准在规模、领域覆盖范围或可执行验证方面受到限制,导致当前 LLM 和可靠的科学代码生成器之间的真正差距没有得到充分评估。为了解决这些限制,我们推出了 SciCodePile,这是迄今为止最大的科学代码语料库,由 37,737 个公共存储库构建而成,总共包含 128GB 的代码,涵盖多个计算科学学科。从这个语料库中,我们进一步策划了 200 个任务的可执行基准测试,每个任务都配备了沙盒执行环境和用于功能验证的自动化测试工具。我们在三个任务上评估来自开源和闭源系列的 15 个 LLM:前缀到后缀完成、中间填充和可执行代码生成。结果表明,科学代码生成仍然极具挑战性:最好的 CodeBLEU 在两项完成任务中仅达到 38.13 和 38.37,而最强模型在可执行基准测试中仅达到 12.30\% Pass@1,这凸显了当前模型距离可靠的科学代码生成还有多远。为了演示 SciCodePile 的训练实用性,我们进一步表明,对我们的语料库进行持续预训练,在科学代码补全方面将 CodeBLEU 提高了 $\times$2.84,并且对我们的数据进行指令调整,在可执行基准测试中将 Pass@1 提高了 $\times$4.79。所有代码和数据均可在 https://huggingface.co/SciCodePile 上获取。