论文
LLM 作为丹麦庇护决策中可信度评估的注释者:评估分类性能和超出汇总指标的错误
LLMs as annotators of credibility assessment in Danish asylum decisions: evaluating classification performance and errors beyond aggregated metrics
摘要
现成的 大语言模型 (LLM) 越来越多地用于自动化文本注释,但对于代表性不足的语言和类定义需要微妙的专家理解的专业领域,其有效性仍未得到充分探索。我们研究了基于 LLM 的注释,以实现一项新颖的法律 NLP 任务:识别庇护决策文本中可信度评估的存在和情绪。我们推出 RAB-Cred,这是一个丹麦文本分类数据集,具有高质量的专家注释和有价值的元数据,例如注释者信心和庇护案件结果。我们针对该任务对 21 个开放权重模型和 30 个系统用户提示组合进行了基准测试,并系统地评估了零样本和少样本分类的模型和提示选择的效果。我们重点关注表现最佳的模型和提示所犯的错误,调查 LLM 中的错误一致性、类间混淆、与人类信心的相关性以及 LLM 错误的样本难度和严重性。我们的结果证实了 LLM 在经济有效地标记庇护决定方面的潜力,但强调了 LLM 注释者的不完美和不一致的性质,以及需要超越单一、任意选择的模型的预测。 RAB-Cred 数据集和代码可在 https://github.com/glhr/RAB-Cred 获取