论文
逐条分类造成高额标注成本:大模型批量标注的准确性与成本
Researchers waste 80% of LLM annotation costs by classifying one text at a time
摘要
大语言模型越来越多地用于社会科学文本分类,但研究者通常在每次提示中仅对一条文本的一个变量标注。10万条文本、四个变量需40万次API调用;每批25条并合并全部变量后,仅需4,000次,词元成本减少80%以上。为检验质量影响,研究用四家提供商的八种生产模型,对四项任务中的3,962条专家标注推文进行评测,批量大小从1到1,000,每次最多合并25个标注维度。八种模型中六种在每批100条以内,准确率与单条基线相差不超过2个百分点。合并最多10个变量的结果接近逐变量标注,性能下降主要由任务复杂性而非提示长度驱动。在所识别的稳定区间中,批量和合并引入的测量误差小于参考数据中常见的人工标注者分歧。