论文
个性化基准测试:按个体偏好评估LLM
Personalized Benchmarking: Evaluating LLMs by Individual Preferences
摘要
随着大语言模型(LLM)能力的提升及其在真实任务中的部署,评估LLM与人类偏好的对齐已成为一项重要挑战。现有基准将所有用户的偏好平均以计算总体评分,在建立模型排名时忽视了个体用户偏好。由于用户在不同情境下偏好各异,我们呼吁建立能按个体需求对模型排序的个性化LLM基准。我们利用ELO评分和Bradley-Terry系数为115位活跃的Chatbot Arena用户计算个性化模型排名,并分析用户查询特征(主题与写作风格)与LLM排名变化之间的关系。我们证明个体层面的LLM排名与总体LLM排名差异巨大:Bradley-Terry相关系数平均仅为$ρ= 0.04$(57\%的用户呈近零或负相关),ELO评分呈中等相关($ρ= 0.43$)。通过主题建模与风格分析,我们发现用户在主题兴趣和沟通风格上存在显著异质性,并影响其模型偏好。我们进一步表明,主题与风格特征的紧凑组合为预测用户特定的模型排名提供了有效的特征空间。我们的结果提供了有力的定量证据,表明总体基准无法捕捉大多数用户的个体偏好,并凸显了开发按个体用户偏好对LLM模型排序的个性化基准的重要性。
