论文
量化基于 LLM 的公共话语立场分析中的不稳定来源
Quantifying the Sources of Instability in LLM-Based Stance Analysis of Public Discourse
摘要
计算社会科学越来越依赖于自动预处理管道——说话者二值化、ASR 转录清理、句子分割——将原始媒体转换为可分析的文本。当这些管道从相同的输入产生不同的输出时,可能会出现两个不同的不稳定源:预处理管道本身(二值化方法、分段规则)和下游测量工具(LLM 注释与\关键字词典)。通过对来自 5 个领域的 41 名公众人物进行 256 次 YouTube 采访,我们比较了两种说话者二值化流程和两种测量方法,所有这些都针对情感效价和认知模态之间的耦合。我们发现(1)预处理管道的敏感性集中在视频样本有限的说话者(N $\leq 5$);对于四个最佳采样的说话者 (N $\geq 16$),$r(\text{neg}, \text{emph})$ 的平均绝对管道引起的变化仅为 $0.13$; (2) 跨方法分歧更大、更系统化——LLM 和关键词词典方法将相反的耦合方向分配给几个采样良好的说话人,即使在同一预处理管道内; (3) 无论管道或方法如何,总价态比例都是高度稳定的 ($|Δp(\text{neg})| < 6$pp),掩盖了两个不稳定源。该贡献是一个将管道效应与测量效应分开的诊断框架:研究访谈数据中跨维度关系的研究人员应该验证他们的结论对于两种变异来源都是稳健的,特别要注意测量方法的选择。