论文

GTA:基于图论的LLM图结构推理基准与智能体

GTA: Graph Theory Agent and Benchmark for Algorithmic Graph Reasoning with LLMs

模型推理推理策略与问题分解

摘要

大语言模型(LLMs)被越来越多地要求对结构化数据如图进行推理,但其在语言中执行多步图算法的可靠性仍不明确。现有评估多使用小图上的简单任务,以代码生成评分代替图本身的推理,或固定单一输入格式。我们提出了图论基准(GT Bench),涵盖44种任务结构下的24个经典图问题,包含超过10万条示例,覆盖自然语言、结构化语言、邻接表和邻接矩阵四种表示形式。在GT Bench上评估八种LLM发现,准确率高度依赖输入表示,最优表示随图密度、规模和拓扑结构以及模型本身而变化,且这种敏感性在最强推理模型中依然存在但有所减弱。基于此观察,我们提出图论智能体(GTA),其通过偏好训练的表示选择器,结合计划与分解的引导策略,围绕一个冻结的执行器LLM进行操作。GTA将Phi-4在基准易任务集上的准确率从53.5%提升至69.1%,在难任务集上从33.0%提升至41.5%,优于八种提示和智能体基线方法,并能在无需重新训练的情况下迁移到GraCoRe和NLGraph。基准生成与评估代码见此链接。项目主页位于此链接。

GTA:基于图论的LLM图结构推理基准与智能体:论文配图
图 1:使用本工作中评估的四种输入模式表示的无向图示例:自然语言、结构化语言、邻接列表和邻接矩阵。