论文
用同质性感知的结构与语义文本属性图压缩改进LLM推理
Improving LLM Reasoning with Homophily-aware Structural and Semantic Text-Attributed Graph Compression
摘要
大语言模型(LLM)在文本属性图(Text-Attributed Graph,TAG)理解上展现出可观能力。近期研究通常聚焦于通过手工提示将图结构言语化,把目标节点及其邻域上下文输入LLM。然而,受上下文窗口限制,现有方法主要诉诸随机采样——常表现为随机丢弃节点/边——这不可避免地引入噪声并造成推理不稳定。我们认为,图本身蕴含丰富的结构与语义信息,有效利用它们可以释放LLM推理性能的潜在增益。为此,我们提出面向LLM的同质性感知结构与语义压缩(Homophily-aware Structural and Semantic Compression,HS2C),一个以利用图同质性为核心的框架。在结构上,以结构熵最小化原则为指导,我们执行全局层次化划分,解码图的本质拓扑。该划分识别出自然内聚的同质社区,同时丢弃随机连接噪声。在语义上,我们将检测到的结构同质性交给LLM,使其能基于预定义的社区类型进行差异化语义聚合。这一过程把冗余背景上下文压缩为简洁的社区级共识,选择性地保留与目标节点对齐的语义同质信息。在不同规模与家族的LLM上、跨10个节点级基准的大量实验表明,通过向LLM输入结构与语义双重压缩后的输入,HS2C同时提升压缩率与下游推理准确率,验证了其优越性与可扩展性。在7个多样图级基准上的扩展进一步巩固了HS2C的任务泛化能力。
