论文
ScaleBox:为 大语言模型 实现高保真和可扩展的代码验证
ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models
摘要
代码沙箱已成为提升 大语言模型 编码能力的关键基础设施,为 RL 训练和评估提供可验证的反馈。然而,现有系统无法在高并发工作负载下提供准确的验证和效率。我们推出了 ScaleBox,这是一种高保真且可扩展的系统,旨在解决大规模代码训练中的这些限制。 ScaleBox 引入了自动化的特殊判断生成和管理、具有无缝多节点协调的跨测试用例的细粒度并行执行,以及用于可重复基准测试的配置驱动的评估套件。一系列实验表明,ScaleBox显着提高了代码验证的准确性和效率。我们进一步的 RLVR 实验表明,ScaleBox 极大地提高了 LiveCodeBench 上的性能和训练稳定性,显着优于启发式匹配基线。通过提供可靠且高吞吐量的基础设施,ScaleBox 促进大规模代码训练中更有效的研究和开发。