论文

语言编码的网络拓扑使 大语言模型 能够推理复杂网络

Language-encoded network topology enables large language models to reason about complex networks

上下文与知识上下文工程

摘要

网络描述了生物学及其他领域的系统,从蛋白质相互作用和社会关系到电网和引文记录。推理此类系统需要了解它们的结构:哪些元素是核心,哪些连接桥接不同的社区,以及当元素被删除时它如何变化。尽管 大语言模型 (LLM) 擅长自然语言,但当网络以边列表、句子或测量表的形式给出时,它们会遇到此类问题,因为必须推断它们的结构含义。在这里我们介绍 BioGlyph,它将网络拓扑编译成可解释和可转移的结构角色语言。 BioGlyph 结合了图分区和结构测量来识别中心、社区核心和跨社区连接器等角色,并固定规则将它们转换为通用词汇表。该表示通过其结构角色描述每个元素,支持证据和语义结果,使网络和 LLM 保持不变。 BioGlyph 跨越五个领域的 20 个网络,显着提高了开放式 LLM 回答结构推理问题的能力,在系统精度方面比基于边缘的数字和学习表示形式高出高达 26 个百分点。消融表明,增益来自于用语义可解释的术语显式编码结构角色。这种增益在密集的社区结构网络中更为突出,而在拓扑结构更容易从文本中推断出来的稀疏网络中则减弱。在出芽酵母蛋白质相互作用网络中,BioGlyph 揭示了生物组织:跨群落连接器富含必需基因,而外围蛋白质则被耗尽。因此,BioGlyph 为语言模型和科学家提供了一种可解释的表示形式,以推理网络结构。