论文
大规模归纳索赔提取
Inductive Claims Extraction at Scale
摘要
社交媒体上的大部分政治话语都是在主张层面上构建和表达的:即声明性的、通常是单条款的陈述,它们传达了对现实的特定解释,范围可以从事实到评估。此外,主张不是随机发生的,而是以模式结合、重复出现,并与不同的世界观联系在一起。当与社交网络分析等结构计算工具结合使用时,主张可以成为研究回声室或极化等政治现象的强大分析单位。在本文中,我们提出了一种管道,它使用大语言模型 (LLM) 从大型社交媒体语料库中归纳提取和分类声明,并将其应用于两个不同的 Twitter 数据集:一个与 2020 年美国总统选举相关,另一个与 2022 年 FIFA 世界杯相关。我们通过根据手动注释的样本测量管道的召回率和精度来全面评估该方法,运行消融研究以隔离其各个组件的贡献,并执行定性误差分析。我们讨论了该方法在计算社会科学研究背景下的价值,并通过展示从每个数据集获得的声明目录来说明其功能。
