论文

GraphDecide:图任务上的 System One 模型基准测试

GraphDecide: Benchmarking System One Models on Graph Tasks

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于图形理解和决策,而 System One 模型(例如 Jev)直接从提供的选项中进行选择。然而,系统一模型在图相关任务上的能力仍不清楚。我们引入了 GraphDecide,这是一种独立于模型的基准测试,它结合了结构任务配置文件、匹配的图文本输入对比和启发式建议控制来诊断图决策性能。我们评估 Jev 和相关的基于选择的模型以及语言模型基线,涵盖十四种模型界面配置。 Jev 的结果说明了该基准的主要区别:准确的邻接识别并不能保证更广泛的结构正确性,联合图文输入不能始终如一地改善预测,可行的构造不能建立高解决方案质量。它的任务契约、候选界面和评分规则支持跨本机选择器和语言模型适配器的比较。代码和汇总结果可在 https://github.com/VictorYXL/JevGraphBench. 获取