论文

LLM-WikiRace:对现实世界知识图的长期规划和推理进行基准测试

LLM-WikiRace: Benchmarking Long-term Planning and Reasoning over Real-World Knowledge Graphs

智能体系统Agent任务评测长程任务评测

摘要

我们提出 LLM-Wikirace,一个评估大语言模型(LLM)规划、推理和世界知识的基准。在 LLM-Wikirace 中,模型必须沿维基百科超链接逐步高效导航,从给定源页面到达目标页面,这需要前瞻规划以及推理现实世界中概念如何关联的能力。我们评估了广泛的开放与闭源模型,包括 Gemini-3、GPT-5 和 Claude Opus 4.5,它们在任务简单级别上取得最强结果,展现超人表现。尽管如此,困难级别下性能骤降:表现最佳的 Gemini-3 在困难对局中仅成功 23%,凸显前沿模型仍面临重大挑战。分析显示,世界知识是成功的必要成分,但仅到一定程度;越过该阈值后,规划与长视界推理能力成为主导因素。轨迹级分析进一步揭示,即便最强模型也难以在失败后重新规划,常陷入循环而非恢复。LLM-Wikirace 是一个简单却揭示当前推理系统明确局限的基准,为具备规划能力的 LLM 提供了仍大有可为的开放竞技场。代码与排行榜见 https:/llmwikirace.github.io。

LLM-WikiRace 基准:LLM 能在真实世界知识图谱上规划多远?
图7:在Human Gameplay Corpus各游戏中,最强大模型与人类玩家所犯次优步骤的对比。人类在该语料库上的成功率为98.5%,所有受测模型为100%。