论文

用大语言模型符号化结构过程实现可解释的无监督社区发现

Interpretable Unsupervised Community Detection with LLM-Symbolized Structured Processes

模型推理推理策略与问题分解

摘要

社区发现是图分析中的一项基础任务,旨在识别具有相似行为或兴趣的内聚实体群体。经典的目标驱动方法难以应对复杂图结构,而深度学习方法以牺牲可解释性为代价提升了性能,并依赖标注数据与训练。大语言模型(LLM)凭借强大的推理能力和世界知识,有望实现可解释、无标注的社区发现。为利用这些优势,我们提出LUCID,一种由LLM引导的、可解释的、免训练的无监督社区发现方法。受自然界中复杂结构经由初始化、合并、细化与选择而涌现的相变动力学启发,LUCID被设计为四阶段流水线。在该流水线中,LLM归纳形式化规则,将隐式知识转化为显式且可解释的逻辑结构。具体而言:(1) 局部视角社区初始化阶段用k-ego上下文和无监督节点角色编码局部图结构;(2) 多因素社区合并阶段使用LLM归纳的规则迭代合并局部社区;(3) 多粒度社区细化阶段并行应用LLM归纳的由粗到细规则以减少边界噪声;(4) 全局视角社区选择阶段基于拓扑紧凑性与边界清晰度识别高质量社区。在真实数据集上的大量实验表明,作为无监督方法的LUCID取得了最先进的性能,并持续超越领先的无监督与半监督基线。

用大语言模型符号化结构过程实现可解释的无监督社区发现:论文配图
图1:LUCID的框架:(1) 初始化阶段为节点分配角色标签,并将图分解为局部的k-ego表示;(2) 合并阶段利用LLM驱动的多因素推理将子图合并为社区候选;(3) 精化阶段通过LLM引导的由粗到细规则生成以及可扩展的执行模块对候选进行精化;(4) 最后,选择阶段通过平衡内部凝聚性与外部分离性来选出最终社区。我们的LLM符号化框架能够以无标签方式实现可解释的社区检测。