论文
用 Prolog 探索语言模型中的长期演绎推理能力
Probing for Long-Horizon Deductive Reasoning Capabilities in Language Models with Prolog
摘要
当前的前沿LLM理论上可以处理具有 1M 或更多token的长上下文。但它们能在多大程度上超越简单的检索并在如此长的上下文中进行更深入的推理呢?我们实证研究LLM的长期推理能力,重点关注 Prolog 中表达的演绎逻辑。我们构建了 ProloNg,一个用于探索 Prolog 长推理的综合测试平台,它系统地改变问题的复杂性(推理深度),其中最难的情况具有 22 和 62k 上下文长度的推理深度。我们研究了 5 个前沿LLM系列的 8 个推理模型,发现随着推理深度的增长,性能大幅下降,大多数模型接近深度 10 以外的概率。