论文

CriterAlign:代码偏好判断的以标准为中心的基本原理对齐

CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging

模型评测评测方法与指标

摘要

成对的人类偏好预测是评估代码生成系统的核心,其中质量通常取决于特定于任务的权衡,而不仅仅是功能正确性。虽然基于评分标准的 LLM 评委通过将评估分解为明确的标准来提高可解释性,但大多数现有管道仍然是逐点的:它们独立地对每个响应进行评分,并通过比较汇总分数来得出偏好。我们表明,这种设计与成对代码偏好预测的匹配度很差,并且可能不如强大的整体判断。我们提出 CriterAlign,一个以标准为中心的框架,通过直接标准级别的成对判断、平局驱动的标准细化、交换一致性过滤和最终的成对综合,将基于标题的判断适应成对偏好评估。我们进一步引入了人类偏好对齐指导(HPAG),通过提取人类偏好和整体判断预测之间反复出现的理由差距,从训练示例中离线合成,并将其注入标准生成器、标准判断和最终判断中。在 BigCodeReward 上,CriterAlign 将 Qwen2.5-VL-32B 整体判断的准确率从 60.4% 提高到 66.3%,并通过消融确认了成对标准设计和 HPAG 的贡献。