论文

NOLLI:用于诊断英语-韩语表现差距的难度校准谜题基准

NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap

模型评测基准与评测资源

摘要

我们推出 NOLLI,一个程序生成的英语-韩语拼图基准,旨在诊断韩语表现差距出现的位置。它包含 15 种谜题类型(25 个任务;7,500 个项目),每个实例都可以重新生成种子,经过验证具有唯一的解决方案,并进行确定性评分。我们不是将难度等同于更大,而是以行为方式校准难度,调整每个生成器,直到固定的参考模型落在目标精度范围内。其三级设计结合了匹配的直接翻译、韩文jamo(亚音节字母)的脚本改编以及基于韩国文化或正字法的仅限韩语的任务。我们评估了 15 个前沿、开放重量、韩国开发的模型;在整体准确率下限高于 3% 的 12 个中,匹配的英语-韩语准确率在统计上相当,在 +/- 10 pp 裕度 (TOST) 之内,这表明仅从演示语言中获得的成本很小。书写系统密集型任务显示出更大的差距:韩语密码落后于英语高达 68.7 pp,而同一 Jamo 上的密码学则没有显示出系统性的损失,而 Jamo 组合准确度可以预测韩语密码的准确度。这些对比是诊断性的,而不是因果性的,与多步骤子音节执行的困难一致。仅限韩语的任务将规则应用赤字(符号不同)与所有 12 种类型中的亲属关系赤字为正值区分开来。最后,在 15 种类型中,有 7 种的显着规模衡量指标未能从简单到困难,这使得结构规模无法可靠地代表经验难度。