论文

使用 LLM 对无监督文本簇进行基于推理的细化

Reasoning-Based Refinement of Unsupervised Text Clusters with LLMs

模型推理推理验证与自校正

摘要

无监督方法被广泛用于从大型文本集合中引入潜在语义结构,但其输出通常包含不连贯、冗余或基础较差的集群,如果没有标记数据,这些集群很难进行验证。我们提出了一种基于推理的细化框架,该框架不利用 大语言模型 (LLM) 作为嵌入生成器,而是作为语义判断来验证和重构任意无监督聚类算法的输出。我们的框架引入了三个推理阶段:(i)一致性验证,其中 LLM 评估聚类摘要是否得到其成员文本的支持; (ii) 冗余裁决,根据语义重叠合并或拒绝候选簇; (iii) 标签与簇内容关联,通过两阶段过程为集群分配可解释的标签,该过程以完全无监督的方式生成和巩固语义上相似的标签。这种设计将表示学习与结构验证分离,并减轻了仅嵌入方法的常见故障模式。我们从具有不同交互模型的两个平台评估了现实世界社交媒体语料库中的框架,证明了相对于经典主题模型和最近的基于表示的基线,集群一致性和人性化标签质量的持续改进。尽管缺乏参考标注,但人类评估显示与 LLM 生成的标签高度一致。我们进一步在匹配的时间和体积条件下进行稳健性分析,以评估跨平台稳定性。除了经验收益之外,我们的结果表明,基于 LLM 的推理可以作为验证和细化无监督语义结构的通用机制,从而能够在没有监督的情况下对大型文本集合进行更可靠和可解释的分析。