论文
GTA:基于图论的LLM图结构推理基准与智能体
GTA: Graph Theory Agent and Benchmark for Algorithmic Graph Reasoning with LLMs
摘要
大语言模型(LLMs)被越来越多地要求对结构化数据如图进行推理,但其在语言中执行多步图算法的可靠性仍不明确。现有评估多使用小图上的简单任务,以代码生成评分代替图本身的推理,或固定单一输入格式。我们提出了图论基准(GT Bench),涵盖44种任务结构下的24个经典图问题,包含超过10万条示例,覆盖自然语言、结构化语言、邻接表和邻接矩阵四种表示形式。在GT Bench上评估八种LLM发现,准确率高度依赖输入表示,最优表示随图密度、规模和拓扑结构以及模型本身而变化,且这种敏感性在最强推理模型中依然存在但有所减弱。基于此观察,我们提出图论智能体(GTA),其通过偏好训练的表示选择器,结合计划与分解的引导策略,围绕一个冻结的执行器LLM进行操作。GTA将Phi-4在基准易任务集上的准确率从53.5%提升至69.1%,在难任务集上从33.0%提升至41.5%,优于八种提示和智能体基线方法,并能在无需重新训练的情况下迁移到GraCoRe和NLGraph。基准生成与评估代码见此链接。项目主页位于此链接。
