论文
通过图算法问题揭示大推理模型的弱点
Exposing Weaknesses of Large Reasoning Models through Graph Algorithm Problems
摘要
大型推理模型(LRM)进展迅速;然而,数学、代码和常识推理方面的现有基准仍然有限:它们缺乏长上下文评估、挑战性不足,并且答案难以用程序验证。我们推出 GrAlgoBench,一个通过图算法问题评估 LRM 的基准。这类问题特别适合探查推理能力:它们要求长上下文推理,允许对难度级别进行细粒度控制,并支持标准化、可程序化验证的评估。跨越九个任务的系统性实验揭示了当前 LRM 的两大弱点。其一,随着上下文长度增加,准确率急剧下降,当图超过 120 个节点时准确率跌破 50%。这种退化由频繁的执行错误、薄弱的记忆以及冗余推理驱动。其二,LRM 存在过度思考现象,主要由大量却基本无效的自我验证造成,它使推理轨迹膨胀而未能提升正确性。通过揭示这些局限,GrAlgoBench 将图算法问题确立为推进 LRM 推理研究的严谨、多维且贴近实用的测试平台。代码发布于 https://github.com/Bklight999/GrAlgoBench。
