论文

EsoLang-Bench:用冷门编程语言评估大语言模型的真实推理能力

EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages

模型评测基准与评测资源

摘要

大语言模型在代码生成基准上实现了接近天花板的性能,但这些结果越来越多地反映了记忆而不是真正的推理。我们引入了 EsoLang-Bench,这是一个使用五种深奥编程语言(Brainfuck、Befunge-98、Whitespace、Unlambda 和 Shakespeare)的基准测试,由于预训练的经济不合理性,这些语言缺乏基准游戏激励。这些语言需要与主流编程相同的计算原语,但公共存储库比 Python 少 1,000-100,000 倍(基于 GitHub 搜索计数)。我们评估了五种提示策略中的五种前沿模型,发现了巨大的能力差距:在标准基准上达到 85-95% 的模型在同等深奥任务上的得分仅为 0-11%,超出简单层的准确率为 0%。小样本学习和自我反思无法提高性能,这表明这些技术利用了训练先验,而不是实现真正的学习。 EsoLang-Bench 提供了第一个旨在模仿人类学习的基准,通过文档、解释器反馈和迭代实验获取新语言,测量抵抗数据污染的可转移推理技能。