论文

大语言模型 能否可靠地编码定性人道主义数据?针对人类专家裁决的基准研究

Can Large Language Models Reliably Code Qualitative Humanitarian Data? A Benchmark Study Against Human Expert Adjudication

模型评测模型能力评测

摘要

来自受影响人群的数据对于为人道主义响应提供信息至关重要,但其价值取决于对需求的细致入微的及时和一致的解释。人道主义组织通常缺乏大规模分析这些信息所需的人员、时间和专业知识。 大语言模型 (LLM) 可能会扩展此容量,但其编码定性人道主义数据的可靠性尚未直接建立。这项基准研究使用 150 个高保真合成人道主义转录本,将 46 LLM 与人类黄金标准进行了比较。评估将评估者间的可靠性测试与 Krippendorff 的 alpha 结合起来,区分正确、接近正确和不正确代码的差异分析,以及跨人道主义特定标准(包括歧视、复杂需求层次结构和非标准沟通方式)的定性评估。作者发现,多个 LLM 可以以与经验丰富的人类编码员相当的可靠性水平执行演绎编码,特别是在使用结构化提示和支持推理的配置时。同时,仅聚合可靠性指标不足以做出部署决策。在识别间接表达的需求、预定义类别之外的需求以及人身安全和歧视等与保护相关的问题方面,模型各不相同。这些发现表明,LLM 可以实质性地扩展人道主义分析能力,但不能替代人类判断。适当的使用需要结构化的编码手册、推理模型、对特定主题性能的关注,以及针对错误编码会产生最大实际项目后果的类别的分层监督。对于敏感的人道主义数据,部署在自托管基础设施上的开放权重模型可能会提供一条将分析可扩展性与更强大的数据治理相结合的可行路径。