论文

当更好的代码本还不够时:LLM 政治事件编码中的预测性能和行为可靠性

When Better Codebooks Are Not Enough: Predictive Performance and Behavioral Reliability in LLM Political Event Coding

模型评测模型能力评测

摘要

高精度并不一定使 LLM 成为忠实的编码器。这个问题很重要,因为许多社会科学研究依赖专家编写的密码本将文本转换为结构化数据。我们研究政治事件编码,其中模型必须识别一个参与者根据详细的编码规则对另一个参与者采取的行动。我们仅将标签名称与简洁的定义和丰富的指南进行比较,其中添加了示例、事件模式指令和边界规则。我们还评估替代提示和检索方法。然后,我们在改变码本顺序、标签名称和标签定义映射的情况下测试行为可靠性。丰富的指导将平均根级宏观 F1 从 0.457 提高到 0.633。当有意义的标签名称被删除时,有权访问定义的方法仍然有效,但在重新分配标签-定义映射后,评估的方法都不会超过 0.20 加权 F1。这些结果促使对预测性能进行单独评估并遵守所提供的编码规则。