论文

从 Rosetta 到 Match-Up:具有人类和 LLM 基准的成对语言难题语料库

From Rosetta to Match-Up: A Paired Corpus of Linguistic Puzzles with Human and LLM Benchmarks

模型评测基准与评测资源

摘要

在本文中,我们研究了高中语言学竞赛中使用的语言谜题,重点关注两种常见的形式:罗塞塔石碑和配对。我们提出了一个系统程序,用于将现有的 Rosetta Stone 谜题转换为相应的配对谜题。由于语言谜题的创建复杂且耗时,因此我们的方法提供了一种加速新谜题生成的有效方法。我们与人类参与者和 大语言模型 (LLM) 一起评估由此产生的 Rosetta Stone 配对。我们的结果表明,人类解谜专家和 LLM 在配对谜题中都表现出全有或全无的模式,要么完全解决,要么完全失败。这项工作提供了一个新的配对谜题数据集,并提供了跨格式谜题难度的详细评估,提供了对人类和机器语言推理的见解。