论文

大语言模型 用于词元效率和语义保留的意见摘要

Large Language Models for Token-Efficient and Semantic-Preserving Opinion Summarization

上下文与知识上下文工程

摘要

有观点的文本 - 涵盖产品评论、酒店反馈和社交帖子 - 捕获有关用户体验、偏好和关注点的丰富信号。然而,此类语料库的规模、冗余和不平衡使得有效分析观点具有挑战性,特别是当目标是生成忠实于所表达观点多样性的摘要时。本文提出了一个框架,该框架在基于 LLM 的意见摘要中保留语义,同时最大限度地减少词元的使用。我们将多维分类(例如情绪、主题)与一系列分层抽样策略相结合,在提示 LLM 之前选择紧凑但具有代表性的意见子集。然后,量身定制的提示会生成平衡的摘要,突出意见中表达的显着方面(例如,产品/酒店的优点和缺点)。对 Amazon 产品评论、Tripadvisor 酒店评论和 X/Twitter 帖子的实验表明,我们的方法显着减少了词元使用和计算成本,同时在内容覆盖率、平衡性和语义保留方面始终优于传统的基于 AI 的标准 LLM 摘要基线。