论文

用同质性感知的结构与语义文本属性图压缩改进LLM推理

Improving LLM Reasoning with Homophily-aware Structural and Semantic Text-Attributed Graph Compression

上下文与知识上下文工程

摘要

大语言模型(LLM)在文本属性图(Text-Attributed Graph,TAG)理解上展现出可观能力。近期研究通常聚焦于通过手工提示将图结构言语化,把目标节点及其邻域上下文输入LLM。然而,受上下文窗口限制,现有方法主要诉诸随机采样——常表现为随机丢弃节点/边——这不可避免地引入噪声并造成推理不稳定。我们认为,图本身蕴含丰富的结构与语义信息,有效利用它们可以释放LLM推理性能的潜在增益。为此,我们提出面向LLM的同质性感知结构与语义压缩(Homophily-aware Structural and Semantic Compression,HS2C),一个以利用图同质性为核心的框架。在结构上,以结构熵最小化原则为指导,我们执行全局层次化划分,解码图的本质拓扑。该划分识别出自然内聚的同质社区,同时丢弃随机连接噪声。在语义上,我们将检测到的结构同质性交给LLM,使其能基于预定义的社区类型进行差异化语义聚合。这一过程把冗余背景上下文压缩为简洁的社区级共识,选择性地保留与目标节点对齐的语义同质信息。在不同规模与家族的LLM上、跨10个节点级基准的大量实验表明,通过向LLM输入结构与语义双重压缩后的输入,HS2C同时提升压缩率与下游推理准确率,验证了其优越性与可扩展性。在7个多样图级基准上的扩展进一步巩固了HS2C的任务泛化能力。

用同质性感知的结构与语义文本属性图压缩改进LLM推理
图2:所提出的 HS 2 C \text{HS}_{2}\text{C} 的整体框架,由 3 个模块组成。首先,我们通过增强图拓扑并最小化 SE 来检测同配(homophilic)结构,得到层次化的社区划分。其次,我们聚合每个社区内背景节点的文本属性,生成简洁且语义对齐的摘要。最后,我们重建压缩图 𝒢 ~ \widetilde{\mathcal{G}},为下游推理保留关键的结构与语义信息。