论文
更少数据、更好对齐:面向偏好优化的数据中心多评估者共识
Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization
摘要
偏好优化研究常常在固定数据的同时改变训练目标。我们反其道而行之,追问一小组高置信度的在策略(on-policy)响应能否提供可靠的学习信号。我们的方法DMAPO(Data-centric Multi-evaluator Agreement for Preference Optimization)从目标策略生成候选响应,用按量规专精的评估器评估有用性、事实性与简洁性,施加过程批评(process-critic)校正,仅保留高共识的合意或不合意样本。该流程在54,236个Mistral-7B候选中接受了1,871个(3.45%)。在该集合上训练的KTO在MT-Bench上达到7.50,对text-davinci-003参考的长度受控胜率为95.5%,IFEval提示词准确率为57.3%。独立的成对评估也更青睐DMAPO而非SimPO:GPT-4o在129个留出提示上给出23.3点的净胜率,在200个分布外LMSYS-Chat提示上给出24.0点;Claude Opus 4.7在留出集上给出24.1点。更换评估器模型或量规会改变被选中的样本,但对下游性能影响甚微。第二个骨干上的研究得到相近的3.41%接受率,不过其性能提升更为温和。综观这些实验,共识过滤为一般指令的偏好优化提供了一条数据高效的路径,代价是额外的筛选计算以及对评估器判断的依赖。
