论文

TextClusterLab:可靠文本聚类研究的集成框架

TextClusterLab: An Integrated Framework for Reliable Text Clustering Studies

模型评测基准与评测资源

摘要

近年来,文本聚类已成为意图发现、主题挖掘和推荐系统等应用的关键技术。然而,评估文本聚类算法仍然具有挑战性,因为许多现实世界的文本数据集由于语义边界模糊、嵌入的高维性和不一致的聚类结构而不适合聚类评估。当前的聚类数据集生成器是为数值数据设计的,为特定于文本的基准测试提供有限的支持。本文介绍了 TextClusterLab,一个用于文本聚类研究的综合框架。 TextClusterLab 提供 大语言模型 (LLM) 驱动的文本聚类数据集生成器,用于生成用于评估聚类算法的合成文本数据集。该生成器支持设置各种聚类属性,例如类不平衡性、簇内紧凑性和簇间多样性。这些生成的数据集可以作为测试文本聚类算法在不同场景下的鲁棒性和多功能性的实用基准。此外,我们引入了一个基准来验证文本数据集是否适合聚类评估。因此,TextClusterLab 为可重复且全面的文本特定聚类研究提供了一个集成框架。我们的 TextClusterLab 可在 https://github.com/research-paper-code/TextClusterLab 上公开获取,并且一些具有各种属性的合成示例数据集可在 https://huggingface.co/datasets/DW-irlab/TextClusterLab 上公开获取。