论文

Themis:训练鲁棒的多语言代码奖励模型以实现灵活的多标准评分

Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring

模型训练奖励建模与过程监督

摘要

奖励模型 (RM) 已成为语言模型 (LM) 后训练 手册中不可或缺的固定装置,可实现策略调整和测试时间扩展。然而,关于 RM 在代码生成中的应用的研究相对较少,现有的工作主要集中在执行反馈上。此选择限制 后训练 优化自包含可执行代码的功能正确性。在这项工作中,我们研究了多语言、多标准代码 RM 的训练和评估。为此,我们首先编译了 Themis-CodeRewardBench,这是一个跨五个偏好维度(即标准)和八种编程语言评估代码 RM 的基准,我们在其中分析了 50 多个代码、数学和通用 RM。观察到当前 RM 在功能正确性评分之外的熟练程度有限,我们开发了 Themis-CodePreference,这是迄今为止最大的开源代码偏好集合(超过 35 万个偏好对),并用它来训练 Themis-RM,这是一套用于灵活的多标准评分的多语言代码奖励模型,参数大小从 600M 到 32B 参数不等。我们的实验和消融证明了积极的扩展趋势、在不同偏好训练时强大的跨语言迁移,以及多标准训练对于可靠的代码奖励建模的重要性。