论文
算法漫画:审计 LLM 在危机事件中生成的政治话语
The Algorithmic Caricature: Auditing LLM-Generated Political Discourse Across Crisis Events
摘要
大语言模型 (LLM) 可以大规模生成流畅的政治文本,引起人们对危机和社会冲突期间合成话语的担忧。现有的人工智能文本检测通常侧重于句子级线索,例如复杂性、突发性或标记不规则性,但随着生成系统的改进,这些信号可能会减弱。相反,我们采用计算社会科学的视角,并询问综合政治话语的行为是否像观察到的在线人口一样。我们构建了涵盖九个危机事件的 1,789,406 个帖子的配对语料库:COVID-19、1 月 6 日国会大厦袭击、2020 年和 2024 年美国大选、多布斯/罗伊诉韦德案、2020 年 BLM 抗议、美国中期选举、犹他州枪击事件和美伊战争。对于每个事件,我们都会将社交平台上观察到的话语与针对相同上下文生成的合成话语进行比较。我们使用平均差距和分散证据评估四个维度:情感强度、结构规律、词汇意识形态框架和跨事件依赖性。在各种事件中,综合话语是流畅的,但人口层面的不切实际。它通常比观察到的话语更消极,情感更分散,结构更规则,词汇更抽象。相反,观察到的话语显示出更广泛的情感变化、更长尾的结构分布以及更多上下文特定的口语词汇标记。这些差异取决于事件:对于快速发展、分散的危机,差异较大;对于正式或机构调解的事件,差异较小。我们用一个简单的事件级度量来总结它们,即漫画差距。我们的研究结果表明,综合政治话语的主要限制不是语法或流畅性,而是人口现实主义的降低。群体层面的审计补充了传统的文本检测,并提供了一个用于评估生成话语的社会现实性的 CSS 框架。