论文

将语言模型基准与成对偏好对齐

Aligning Language Model Benchmarks with Pairwise Preferences

模型评测评测方法与指标

摘要

语言模型基准是真实世界性能普遍且计算高效的代理。然而,近期许多工作发现基准常常无法预测真实效用。为弥合这一差距,我们提出基准对齐(benchmark alignment),即利用有限的模型性能信息自动更新离线基准,旨在生成能在给定测试设置下预测模型成对偏好的新静态基准。我们随后提出 BenchAlign,该问题的首个解决方案,它利用语言模型的问题级性能以及可在部署期间收集的模型排名对,学习与偏好对齐的基准问题加权,生成能按这些偏好对先前未见模型排序的新基准。我们的实验表明,对齐后的基准能够按照人类偏好模型准确地对未见模型排序,即使跨不同规模也是如此,同时保持可解释性。总体而言,我们的工作为将基准与实际人类偏好对齐的极限提供洞见,这有望加速模型开发朝真实效用迈进。

将语言模型基准与成对偏好对齐
图1:BenchAlign 概览。初始状态下,我们有一个模型排序与目标偏好不一致的基准。BenchAlign 利用基准性能和目标模型排序来学习与偏好对齐的题目重加权。在推理阶段,在重加权后的基准上评估的模型,其排序将与目标偏好保持一致。