论文
CLUBench:聚类基准
CLUBench: A Clustering Benchmark
摘要
聚类是数据科学中的一个基本问题,有着悠久的研究历史,产生了许多富有洞察力的算法。尽管取得了这些进展,但联合考虑传统算法、基于深度学习的方法和最近基于模型的聚类的系统性和大规模的实证评估仍然很大程度上缺乏,导致对算法选择和部署的指导有限。为了解决这一差距,我们引入了 CLUBench,这是一个全面的聚类基准测试,由 24 种不同原理的算法组成,在 131 个表格、文本和图像数据集上进行评估,涉及 178,815 次实验。重要的是,我们对(i)超参数调整的影响,(ii)数据类型和特征的影响,(iii)预训练嵌入的影响,(iv)基于大语言模型的聚类,(v)算法的相似性,以及(vi)性能矩阵的低秩结构的分析,为聚类研究提供了有意义的见解和有希望的途径。例如,我们的研究表明:1)所有评估的深度聚类方法在平均性能方面与表现最好的传统聚类算法(例如 KMeans、SpeClu)相比并没有表现出显着的优势; 2) 对于图像和文本聚类任务,将预训练嵌入与传统聚类算法(例如 KMeans、SpeClu)相结合,可提供有效且高效的聚类; 3)即使在基础模型日益占主导地位的时代,聚类仍然是一个具有挑战性且重要的问题。此外,我们建议在跨模型性能矩阵中使用低秩结构来有效地近似实际应用中的整体性能评估。我们进一步证明了基于所有超参数配置的性能矩阵选择模型的可行性。