论文

语言模型对齐的代码一致性偏好优化验证

Code Consistency Preference Optimization Verification for Language Model Alignment

模型训练偏好优化

摘要

基于执行的验证通过计算稳健性和依赖性感知过滤增强大型语言模型的数学推理。然而,依赖 Bradley-Terry 奖励模型的先前偏好优化方法无法捕获科学任务所需的逻辑依赖性和执行一致性。我们提出了一种方法,可以生成具有依赖图的计算合理的解决方案,以实现执行一致的偏好优化。我们首先使用 UltraFeedback 提示、模型生成、验证和一致性结果构建科学推理数据集。然后,我们提取推理步骤表达式、先决条件和可导性关系来构建依赖图并计算执行一致性分数。这些分数附加到每个步骤,创建配对的训练数据。微调 Llama-3-8B 和 DeepSeekMath-7B 会产生显着的收益:MATH 上 +17.0%,GSM8K 上 +15.1%。扩展我们的科学可行性控制框架,在 PhyX 多模态物理推理上实现了 50.1% 的准确率,超过了 DeepSeek-R1 (49.8%) 和 OpenAI o3-mini (48.2%),在 alpha=0.10 时科学有效性覆盖率达到 91.7%,科学违法行为减少了 73%,从而产生了 CCPO 模型系列。