论文
利用加权句法和语义上下文评估摘要 (wSSAS) 使用 LLM 进行文本分类
Leveraging Weighted Syntactic and Semantic Context Assessment Summary (wSSAS) Towards Text Categorization Using LLMs
摘要
使用 大语言模型 (LLM) 进行可靠的企业级分析(例如文本分类)通常会受到注意力机制的随机性和对噪声的敏感性的阻碍,从而影响其分析精度和再现性。为了解决这些技术摩擦,本文引入了加权句法和语义上下文评估摘要(wSSAS),这是一个确定性框架,旨在增强大规模混沌数据集的数据完整性。我们提出了一个两阶段的验证框架,首先将原始文本组织成包含主题、故事和集群的分层分类结构。然后,它利用信噪比 (SNR) 来优先考虑高价值的语义特征,确保模型的注意力仍然集中在最具代表性的数据点上。通过将此评分机制合并到摘要摘要 (SoS) 架构中,该框架可以有效隔离重要信息并减轻数据聚合期间的背景噪音。在不同数据集(包括 Google Business 评论、Amazon 产品评论和 Goodreads 图书评论)中使用 Gemini 2.0 Flash Lite 的实验结果表明,wSSAS 显着提高了聚类完整性和分类准确性。我们的研究结果表明,wSSAS 降低了分类熵,并提供了一种可重复的途径,用于改进基于 LLM 的摘要,该摘要基于大规模文本分类的高精度、确定性过程。