论文
GRACE:面向可扩展混合数据聚类的大语言模型锚定语义度量空间
GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering
摘要
对混合表格数据进行聚类需要一个统一的度量空间,以弥合连续数值测量与离散类别符号之间的固有异构性。传统上,算法完全依赖数据集内部统计来估计类别关系,这使所学度量局限于经验共现,忽视了概念上显而易见、但统计上未被观测到的亲和性。尽管大语言模型(LLM)提供外部世界知识,但将其以文本为中心的推理应用于高度抽象的表格概念仍面临重大挑战。弥合这一模态鸿沟以构建语义完整的度量,通常需要将大语言模型嵌入迭代式度量学习循环中,动态优化跨模态表示。这会带来难以处理的开销,迫使在语义丰富性与可扩展性之间妥协。因此,我们提出GRACE,一个面向可扩展混合数据聚类的大语言模型锚定框架。GRACE通过多视角大语言模型查询策略把语义获取下沉到属性-值层面,将异构值映射为知识增强的描述。关键在于,这种一次性锚定提取出通用语义表示,将异构属性嵌入统一空间,把昂贵的大语言模型调用与迭代优化解耦。此外,GRACE用数据集内部统计证据交叉验证这些外部语义,确保与数据集特定的簇结构对齐。最终,GRACE在达到传统统计驱动基线可扩展性的同时,在11个竞争方法中取得更优的聚类准确率与概念可解释性。源代码可在 https://github.com/develop-yang/GRACE-GRACE-A 获取。
