论文
JEV 与LLM:七个政治学复制的准确性、成本和校准
JEV versus LLMs: Accuracy, Cost and Calibration on Seven Political Science Replications
摘要
大语言模型 (LLM) 通过生成文本token来注释和缩放政治文本或结构。 TypeSafe 将一类新模型称为“System One”模型,它会返回用户提供的固定答案集中的决策和概率分布。商业模型 JEV 被宣传为比传统的LLM具有巨大的成本和速度优势以及更好的校准决策。因此,对于希望快速且经济高效地注释或缩放大型语料库文本并拥有分类器不确定性的可靠指标的社会科学家来说,它可能很有用。然而,这些说法的准确性以及基于社会科学文本的任务中更广泛的模型准确性尚未确定。在本文中,我们就是这样做的,并希望确定 JEV 对于社会科学任务的适用性。我们将 JEV 与LLM和来自已发表研究的人类编码员,以及当前的中层商业LLM (GPT-6 Luna) 和开放权重替代品 (Qwen3.8-27B) 进行比较。我们发现 JEV 在各种任务中与LLM的功能相匹配或接近。然而,我们发现在 OpenAI 的批量价格下,与 GPT-6 Luna 相比并没有成本优势。此外,我们发现,当每个问题被问一次时,JEV 的概率比 GPT-6 Luna 的token概率校准得更好,但并不总是比 Qwen3.8-27B 更好。我们的结论是,除非研究人员需要速度,否则 JEV 唯一明显的优势是易于解析潜在的选择概率。