论文
大语言模型中复杂图推理的统一多维基准
Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models
摘要
图推理为评估 大语言模型 (LLM) 的推理能力提供了一个有前途的测试平台,因为图实例可以通过编程方式生成、结构控制并自然地缩放到长输入设置。然而,现有的图推理基准对数据复杂性的覆盖范围有限,严重依赖人工构建,并且缺乏跨文本和代码推理模式的统一评估。为了解决这些限制,我们提出了 {\dataset},一个五阶段 \textit{半自动} 框架,用于构建复杂的图形推理基准。它沿着五个维度扩展了基准测试覆盖范围:\textit{图形大小}、\textit{任务复杂性}、\textit{任务描述}、\textit{图形加载}和\textit{任务源}。该框架使用基于 LLM 的数据生成器自动生成任务描述、图形数据、参考解决方案、图形加载脚本、问题形式和评估脚本,同时在关键质量控制阶段保留人工验证。在此基础上,我们构建了一个包含 202 美元任务的基准,并在基于文本、基于代码和增强推理设置下评估 LLM。实验表明,复杂性维度揭示了模型的局限性,而这些局限性在现有基准测试中不太明显;现有的微调模型很难推广到 GraphGym,而检索增强方法显示出依赖于场景的适应性,改善了文本推理,但并不能持续改善编码推理。这些发现表明我们的方法可以作为图推理的具有挑战性和诊断性的基准,并为未来的增强方法提供经验指导。代码和数据集将很快发布。