论文
社交文本情感判断:人类、专用工具与大模型的分歧
Nobody Truly Agrees on Sentiment: Humans, Bespoke Tools, and LLMs Struggle with Social Media Texts
摘要
社交媒体是实时公众情绪的丰富来源,但广泛使用的情绪分析工具往往在不了解其局限性的情况下进行应用。在本研究中,我们针对 100 条推文中的 6 名人类评分者,评估了三种定制情感分析工具(TextBlob、VADER 和 Twitter-roBERTa-base)和三种大型语言模型(LLM:Qwen3-32B、GPT-OSS-120B、Llama-4-Maverick-17B)的评分者间可靠性。我们使用两种统计方法来衡量一致性:用于成对比较的 Cohen's kappa 和用于多个评估者的 Fleiss'kappa。即使在人类评估者中,我们的结果也仅显示出相当的一致性,凸显了情绪分析的主观性。在人类和自动化工具中,二元情绪分类(负面与非负面以及正面与非正面)下的一致性高于三类分类下的一致性。 Twitter-roBERTa-base 模型显示出与人类评分的最强一致性,优于定制情绪工具和LLM,特别是在区分负面与非负面方面 情绪。LLM之间表现出显着的一致性,并且与人类具有中度到显着的一致性,在积极分类和非积极分类中表现更好。我们的研究结果强调,特定领域的微调对于可靠的社交媒体情绪分析仍然至关重要,而以人为本的评估对于建立黄金标准标签仍然至关重要。
