论文

评估计算社会科学中文本注释的决策模型

Evaluating Decision Models for Text Annotation in Computational Social Science

模型评测鲁棒性、公平性与可信度评测

摘要

计算社会科学越来越依赖大型语言模型进行文本注释,而已发表研究结果的有效性现在取决于此类模型生成的标签。决策模型是为分类问题回答而构建的新模型类,它可以通过选择、标签集上的概率分布以及置信度得分(而不是自由文本)来回答键入的问题,而成本只是前沿推理成本的一小部分。他们的答案是否准确,以及这种信心在社会科学结构上是否可信,都不得而知。在这里,我们反映了 Ziems 等人的评价。 (2024)在 18 个计算社会科学分类任务(7,977 个项目)上,将第一个商业决策模型和两个开放权重模型与相同零样本协议下的 19 个前沿和开放权重语言模型进行比较,并将决策模型比较扩展到一周后发布的 11 个开放权重系统。该决策模型在 15 项评估任务中的 14 项上落后于每项任务最佳大语言模型,中位赤字为 11.6 个宏观 F1 点,中位测量成本低 44 倍。它的置信度比 19 名大语言模型中的 16 名的口头置信度得到了更好的校准,但三个前沿模型显示出较低的中值校准误差(0.157 对 0.066)。虽然置信度高于 0.9 的项目通常会被准确标记(中位数准确度为 0.815),但在一项任务(即同伴支持对话中的同理心)中,该模型报告了高置信度,同时表现接近偶然。尽管如此,我们的结果表明,决策模型作为注释管道中的第一步是有用的:将低置信度项目路由到 LLM 与仅 LLM 匹配或超过其成本的四分之一到一半。