论文
神奇的文字还是有条不紊的工作?基于 LLM 的政治文本注释挑战传统智慧
Magic Words or Methodical Work? Challenging Conventional Wisdom in LLM-Based Political Text Annotation
摘要
政治学家正在迅速采用 大语言模型 (LLM) 进行文本注释,但注释结果对实施选择的敏感性仍然知之甚少。大多数评估测试单一模型或配置;模型选择、模型大小、学习方法和提示风格如何相互作用,以及流行的“最佳实践”是否能够在受控比较中幸存下来,这些在很大程度上还没有被探索过。我们对这些管道选择进行了受控评估,在相同的量化、硬件和提示模板条件下测试了四个政治科学注释任务中的六个开放权重模型。我们的中心发现是方法论上的:相互作用效应主导主效应,因此看似合理的管道选择可能会成为相应的研究人员自由度。没有单一的模型、提示风格或学习方法是一律优越的,而且表现最好的模型因任务而异。接下来是两个推论。首先,模型大小对于成本和性能来说都是不可靠的指导:跨系列效率差异如此之大,以至于一些较大的模型比小得多的替代方案占用的资源更少,而在模型系列中,中档变体通常与较大的模型相匹配或超过。其次,广泛推荐的即时工程技术会对注释性能产生不一致的、有时甚至是负面的影响。我们利用这些基准测试结果来开发一个验证优先的框架 - 包括管道决策的原则性排序、即时冻结和保留评估指南、报告标准和开源工具 - 帮助研究人员透明地驾驭这个决策空间。