论文

更少数据、更好对齐:面向偏好优化的数据中心多评估者共识

Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization

模型训练合成数据

摘要

偏好优化研究常常在固定数据的同时改变训练目标。我们反其道而行之,追问一小组高置信度的在策略(on-policy)响应能否提供可靠的学习信号。我们的方法DMAPO(Data-centric Multi-evaluator Agreement for Preference Optimization)从目标策略生成候选响应,用按量规专精的评估器评估有用性、事实性与简洁性,施加过程批评(process-critic)校正,仅保留高共识的合意或不合意样本。该流程在54,236个Mistral-7B候选中接受了1,871个(3.45%)。在该集合上训练的KTO在MT-Bench上达到7.50,对text-davinci-003参考的长度受控胜率为95.5%,IFEval提示词准确率为57.3%。独立的成对评估也更青睐DMAPO而非SimPO:GPT-4o在129个留出提示上给出23.3点的净胜率,在200个分布外LMSYS-Chat提示上给出24.0点;Claude Opus 4.7在留出集上给出24.1点。更换评估器模型或量规会改变被选中的样本,但对下游性能影响甚微。第二个骨干上的研究得到相近的3.41%接受率,不过其性能提升更为温和。综观这些实验,共识过滤为一般指令的偏好优化提供了一条数据高效的路径,代价是额外的筛选计算以及对评估器判断的依赖。

更少数据、更好对齐:面向偏好优化的数据中心多评估者共识:论文配图
图 1:DMAPO 流程概览和主要 MT-Bench 结果。 (A) 从 14,272 个提示池中,经过专门的评估器评分、​​有界过程批评家和置信/方差门控后,13,559 个提示训练分割产生 54,236 个符合政策的候选者和 1,871 个二元标记训练示例(3.45% 接受度)。 (B) 在 Mistral-7B-Instruct-v0.2 上,DMAPO 使用 1,871 行达到 7.50 的 MT-Bench 分数。该小组报告一个基准,而不是 Qwen 门控的诊断胜率;独立的成对结果如表 2 所示。