论文
针对 LLM 的卡片:大语言模型 中幽默对齐的基准测试
Cards Against LLMs: Benchmarking Humor Alignment in Large Language Models
摘要
幽默是人类交流中最具文化内涵和社会意义的维度之一,但作为 大语言模型 (LLM) 对齐的维度,它在很大程度上仍未被探索。在这项研究中,五个前沿语言模型与人类玩家玩相同的反人类纸牌游戏(CAH)。这些模型在 9,894 轮中从 10 张候选卡中选择了最有趣的反应。虽然所有模型都超过了随机基线,但与人类偏好的一致性仍然有限。更引人注目的是,模型之间的一致程度远高于与人类的一致程度。我们表明,这种偏好在一定程度上是由系统的位置偏差和内容偏好来解释的,这就提出了一个问题:LLM 幽默判断是否反映了真正的偏好或推理和对齐的结构性产物。