论文
文本分析评估框架:LLM 和社交媒体案例研究
Text Analytics Evaluation Framework: A Case Study on LLMs and Social Media
摘要
LLM 在广泛的 NLP 任务中表现出了卓越的熟练程度。然而,在实际的数据分析场景中仍然存在显着的差距,特别是当需要 LLM 来处理长序列的非结构化文档时,例如新闻源或如本文特别提到的社交媒体帖子。为了在这种情况下实证评估 LLM 的有效性,我们引入了一个基于问题的评估框架,其中包含 470 个手动策划的问题,旨在评估 LLM 对聚合文本数据的语义理解和推理能力。我们将基准测试应用于涵盖各种 NLP 任务的各种 Twitter 数据集,包括情绪分析、仇恨言论检测和情绪识别。我们的结果表明,性能在很大程度上取决于输入规模和数据源的复杂性,在多标签或目标相关场景中显着下降。此外,随着任务复杂度的增加,性能从基本的语义存在识别逐渐下降到要求更高的操作,如比较、计数和计算。此外,随着输入大小超过 500 个实例,我们发现 LLM(尤其是开放权重模型)的一个常见限制:性能大幅下降,尤其是在数值任务上。这些发现突出了当前 LLM 对大型文本集合执行严格定量分析的关键架构瓶颈。