论文

LLM 注释器失败的地方:使用 LLM 在图上进行无标签学习

Where LLM Annotators Fail: Label-Free Learning on Graphs with LLMs

模型训练合成数据

摘要

图上的节点分类通常需要标记节点,但在图尺度上获取标签的成本很高。当节点属性包含语义内容(例如论文摘要、网页或产品描述)时,大语言模型(LLM)可以通过注释一小部分节点来提供低成本监督。然而,这些 LLM 生成的标签是有噪声的,现有的无标签图学习方法通​​常将这种噪声视为全局噪声或类条件噪声。我们发现 LLM 注释错误不仅与类相关,而且与区域相关:在同一类中,不同特征空间簇的可靠性可能会有很大差异。鉴于此,我们提出了集群感知噪声估计(CANE),这是一种无标签学习框架,可以在没有 真值 标签的情况下估计集群条件 LLM 可靠性,并使用此估计来决定信任哪些伪标签以及纠正哪些标签。在各种图基准和 GNN 主干中,CANE 比最强的无标签基线有所改进,数据集上的最大增益表现出更强的集群条件噪声。