论文
HyperGVL:超图理解和推理中的大型视觉语言模型的基准测试和改进
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
摘要
大型视觉语言模型 (LVLM) 始终需要新的领域来指导其不断扩展的边界,但其超图功能仍未得到探索。在现实世界中,超图在生命科学和社会社区等领域具有重要的实际应用。 LVLM 的最新进展在理解复杂拓扑方面显示出了希望,但仍然缺乏用超图来描述 LVLM 功能的基准,导致其能力界限不明确。为了填补这一空白,在本文中,我们引入了 $\texttt{HyperGVL}$,这是第一个评估 LVLM 在超图理解和推理方面的熟练程度的基准。 $\texttt{HyperGVL}$ 提供对 12 个高级 LVLM 的全面评估,涵盖 84,000 个视觉语言问答 (QA) 样本,涵盖 12 个任务,从基本组件计数到复杂的 NP 难题推理。所涉及的超图包含多尺度合成结构以及现实世界的引文和蛋白质网络。此外,我们检查了 12 种文本和视觉超图表示的效果,并引入了一个可泛化的路由器 $\texttt{WiseHyGR}$,它通过学习自适应表示来改进超图中的 LVLM。我们相信这项工作在连接超图与 LVLM 方面向前迈出了一步。