论文

HumorRank:用于评估 大语言模型 中幽默生成的基于锦标赛的排行榜

HumorRank: A Tournament-Based Leaderboard for Evaluating Humor Generation in Large Language Models

模型评测基准与评测资源

摘要

在 大语言模型 (LLM) 中评估幽默是一项公开的挑战,因为现有方法产生孤立的、不可比较的指标,而不是统一的模型排名,使得跨系统跟踪进度变得困难。我们推出 HumorRank,一个基于锦标赛的评估框架和文本幽默生成排行榜。在两个公共基准(SemEval-2026 MWAHAHA 和 Humor Transfer Bench)上,我们对涵盖专有系统、开放权重系统和专用系统的九个模型进行了广泛的自动成对评估。成对判断是由 LLM 法官基于语言幽默通论 (GTVH) 产生的:每个法官将结构化喜剧分析融入到裁决中,共同产生偏好决定、可解释的理由、机制、交付和失败标签,而不是黑盒搞笑评分。评判通过自适应瑞士锦标赛进行汇总,并通过 Bradley-Terry 最大似然估计 (MLE) 生成全球一致的幽默生成能力排名。排名是跨评委稳定的:独立的 LLM 评委(Llama 3.3 70B 和 Qwen 2.5 72B)在两个基准上得出 Kendall tau = 0.889,并且人类校准研究显示人类 - LLM 一致性跟踪在硬搞笑与搞笑对上的人与人之间的一致性。我们的结果表明,HumorRank 产生了基于统计的模型分层,表明幽默质量与对喜剧机制(例如不协调、简洁、升级和荒谬)的掌握有关,而不仅仅是模型规模,经过专门微调的模型可以与更大的系统相媲美。因此,HumorRank 提供了一种可扩展、可解释和可重复的方法,用于基准测试和理解 LLM 生成的幽默。