论文

GRACE:面向可扩展混合数据聚类的大语言模型锚定语义度量空间

GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering

应用与实践结构化分析、预测与决策

摘要

对混合表格数据进行聚类需要一个统一的度量空间,以弥合连续数值测量与离散类别符号之间的固有异构性。传统上,算法完全依赖数据集内部统计来估计类别关系,这使所学度量局限于经验共现,忽视了概念上显而易见、但统计上未被观测到的亲和性。尽管大语言模型(LLM)提供外部世界知识,但将其以文本为中心的推理应用于高度抽象的表格概念仍面临重大挑战。弥合这一模态鸿沟以构建语义完整的度量,通常需要将大语言模型嵌入迭代式度量学习循环中,动态优化跨模态表示。这会带来难以处理的开销,迫使在语义丰富性与可扩展性之间妥协。因此,我们提出GRACE,一个面向可扩展混合数据聚类的大语言模型锚定框架。GRACE通过多视角大语言模型查询策略把语义获取下沉到属性-值层面,将异构值映射为知识增强的描述。关键在于,这种一次性锚定提取出通用语义表示,将异构属性嵌入统一空间,把昂贵的大语言模型调用与迭代优化解耦。此外,GRACE用数据集内部统计证据交叉验证这些外部语义,确保与数据集特定的簇结构对齐。最终,GRACE在达到传统统计驱动基线可扩展性的同时,在11个竞争方法中取得更优的聚类准确率与概念可解释性。源代码可在 https://github.com/develop-yang/GRACE-GRACE-A 获取。

GRACE:面向可扩展混合数据聚类的大语言模型接地语义度量空间:论文配图
图1:GRACE框架概览。给定包含类别属性和数值属性的原始表格数据,GRACE通过基于LLM的提示为每个属性值生成自然语言描述。生成的描述被送入transformer编码器f_θ以获得语义表示𝐞_i∈ℰ。为提高语义亲和度的可靠性,统计编码器从原始属性值生成表示𝐡_i∈ℋ,用于校验语义邻居。为联合利用两个空间,邻域一致性机制计算Γ_ij=NN_ij^sem·NN_ij^stat,对语义亲和矩阵进行精化。基于精化后的亲和度,基于eigengap的图稀疏化确定谱聚类的最优稀疏度。