论文
谁来定义"最佳"?迈向交互式、用户自定义的LLM排行榜评估
Who Defines "Best"? Towards Interactive, User-Defined Evaluation of LLM Leaderboards
摘要
LLM排行榜被广泛用于比较模型并指导部署决策。然而,排行榜排名是由基准设计者设定的评估优先级塑造的,而非由实际用户和组织的多样化目标与约束决定。单一的聚合分数往往掩盖了模型在不同提示类型与构成上的行为差异。在这项工作中,我们对LMArena(前身为Chatbot Arena)基准所使用的数据集进行了深入分析,并通过设计一个交互式可视化界面作为设计探针来研究这一评估难题。我们的分析揭示:该数据集严重偏向某些主题,模型排名在不同提示切片上存在差异,且基于偏好的判断被以模糊其预期适用范围的方式使用。基于这一分析,我们引入一个可视化界面,允许用户通过选择并加权提示切片来定义自己的评估优先级,并探索排名如何随之变化。一项定性研究表明,这种交互式方式提升了透明度,并支持更贴合具体情境的模型评估,为LLM排行榜的设计与使用指出了替代性路径。
