论文
LLM-WikiRace:对现实世界知识图的长期规划和推理进行基准测试
LLM-WikiRace: Benchmarking Long-term Planning and Reasoning over Real-World Knowledge Graphs
摘要
我们提出 LLM-Wikirace,一个评估大语言模型(LLM)规划、推理和世界知识的基准。在 LLM-Wikirace 中,模型必须沿维基百科超链接逐步高效导航,从给定源页面到达目标页面,这需要前瞻规划以及推理现实世界中概念如何关联的能力。我们评估了广泛的开放与闭源模型,包括 Gemini-3、GPT-5 和 Claude Opus 4.5,它们在任务简单级别上取得最强结果,展现超人表现。尽管如此,困难级别下性能骤降:表现最佳的 Gemini-3 在困难对局中仅成功 23%,凸显前沿模型仍面临重大挑战。分析显示,世界知识是成功的必要成分,但仅到一定程度;越过该阈值后,规划与长视界推理能力成为主导因素。轨迹级分析进一步揭示,即便最强模型也难以在失败后重新规划,常陷入循环而非恢复。LLM-Wikirace 是一个简单却揭示当前推理系统明确局限的基准,为具备规划能力的 LLM 提供了仍大有可为的开放竞技场。代码与排行榜见 https:/llmwikirace.github.io。
