论文
用五个大语言模型进行英文歌词文化分析的重复测量研究
A Repeated-Measurement Study for Cultural Analytics of English Song Lyrics Using Five Large Language Models
摘要
大语言模型 (LLM) 越来越多地用于注释文化文本,其规模对于人类编码人员来说是不切实际的。然而,在它们的输出被视为潜在社会结构的测量之前,有必要确定这些测量是否可靠。本研究评估了五个 LLM 作为英语歌词中表达的四种社会结构的零样本注释者:自尊、自我控制、寻求归属感和寻求认可。使用大型歌词语料库的重复注释,我们检查了基于 LLM 的测量的三个属性:重复运行的一致性、模型之间的收敛性以及共识标签到监督分类的可转移性。研究结果表明,基于 LLM 的测量在不同结构中的可靠性并不统一。自尊在各个模型中表现出最强的重复测量可靠性,而寻求认可通常不太稳定;自我控制和寻求归属感表现出中等但依赖于模型的可靠性。下游分类进一步表明共识 LLM 标签包含可学习信号,尽管可转移性本身并不建立构造有效性。因此,在 LLM 注释被视为文化分析中的可扩展测量之前,应报告重复测量稳定性和跨模型收敛。