论文
LLM在最简单长链推理任务上表现如何:等价类问题的实证研究
How Well Do LLMs Perform on the Simplest Long-Chain Reasoning Tasks: An Empirical Study on the Equivalence Class Problem
摘要
大语言模型(LLM)近年取得巨大进步。然而LLM对推理任务——尤其长链推理——究竟多好仍不清楚。本文在最简单却长链的推理任务上评估LLM:等价类问题(ECP),即在给定随机生成的等价关系集合时判断两个变量是否相等。我们考虑推理与非推理代表LLM,跨大量问题实例:不同变量数、连通概率、提示与其他因素。实验结果显示:非推理LLM在ECP上失败,推理模型显著更好但仍难以完全解决该问题。有趣的是,在固定变量数下考虑不同连通概率时我们观察到:对非推理模型,最难的实例恰与ln n/(n-1)的相变点重合,提示问题的混沌性;相比之下,对推理模型,最难的与最大直径重合,提示该问题的推理难度。
