论文

LLM在最简单长链推理任务上表现如何:等价类问题的实证研究

How Well Do LLMs Perform on the Simplest Long-Chain Reasoning Tasks: An Empirical Study on the Equivalence Class Problem

模型评测模型能力评测

摘要

大语言模型(LLM)近年取得巨大进步。然而LLM对推理任务——尤其长链推理——究竟多好仍不清楚。本文在最简单却长链的推理任务上评估LLM:等价类问题(ECP),即在给定随机生成的等价关系集合时判断两个变量是否相等。我们考虑推理与非推理代表LLM,跨大量问题实例:不同变量数、连通概率、提示与其他因素。实验结果显示:非推理LLM在ECP上失败,推理模型显著更好但仍难以完全解决该问题。有趣的是,在固定变量数下考虑不同连通概率时我们观察到:对非推理模型,最难的实例恰与ln n/(n-1)的相变点重合,提示问题的混沌性;相比之下,对推理模型,最难的与最大直径重合,提示该问题的推理难度。

LLM在最简单长链推理任务上表现如何:等价类问题的实证研究:论文配图
图 1:缩放限制。最大错误率与问题大小 (nn)。左图报告了非推理模型,其峰值误差随着变量集的增长而急剧上升。右侧面板报告推理模型,该模型大大减少了错误规模,但在较大实例下仍然暴露非零故障。每个点都是在该问题大小的扫描概率范围内观察到的最大误差。