论文

使用 GMM 和 LLM 通过目标数据增强进行不平衡数据聚类

Imbalanced Data Clustering via Targeted Data Augmentation Using GMM and LLM

模型训练合成数据

摘要

在自然语言处理 (NLP) 中,处理代表性不足的主题具有挑战性,尤其是在聚类可能无法充分捕获少数主题的无监督任务中。为了应对这一挑战,我们的论文提出了一种新颖的无监督数据增强方法,该方法集成了高斯混合模型(GMM)和 大语言模型 (LLM)。由于其灵活性和鲁棒性,GMM 可以检测与数据中代表性不足的区域相对应的聚类,而 LLM 创建合成文档来丰富这些聚类并改善其表示。对各种不平衡文本数据集的实验表明,我们的方法在所有情况下都保留了聚类性能,并且通常增强了聚类的可解释性,为改善无监督 NLP 任务中的数据表示提供了强大且可扩展的解决方案。