论文

谁来定义"最佳"?迈向交互式、用户自定义的LLM排行榜评估

Who Defines "Best"? Towards Interactive, User-Defined Evaluation of LLM Leaderboards

模型评测评测方法与指标

摘要

LLM排行榜被广泛用于比较模型并指导部署决策。然而,排行榜排名是由基准设计者设定的评估优先级塑造的,而非由实际用户和组织的多样化目标与约束决定。单一的聚合分数往往掩盖了模型在不同提示类型与构成上的行为差异。在这项工作中,我们对LMArena(前身为Chatbot Arena)基准所使用的数据集进行了深入分析,并通过设计一个交互式可视化界面作为设计探针来研究这一评估难题。我们的分析揭示:该数据集严重偏向某些主题,模型排名在不同提示切片上存在差异,且基于偏好的判断被以模糊其预期适用范围的方式使用。基于这一分析,我们引入一个可视化界面,允许用户通过选择并加权提示切片来定义自己的评估优先级,并探索排名如何随之变化。一项定性研究表明,这种交互式方式提升了透明度,并支持更贴合具体情境的模型评估,为LLM排行榜的设计与使用指出了替代性路径。

谁来定义"最佳"?迈向交互式、用户自定义的LLM排行榜评估:论文配图
图 1.LMArena 数据集主题分布的树状图可视化。我们构建了一个三级主题层次结构,并可视化了该图中的前两级;矩形区域与每个类别中的提示数量成正比。该分布显示出明显偏向开发人员和人工智能相关主题,这些主题合计占数据集的 30%,反映了特定人群的兴趣。