大语言模型的评估者间可靠性和推理叙事特征的基于规则的注释:土耳其语料库的三项研究
Inter-Rater Reliability of LLM and Rule-Based Annotation for Inferential Narrative Features: Three Studies on a Turkish Corpus
摘要
自动生成特征注释的数据集引发了一个很少被问到的问题:人类会同意这些标签吗?本报告回答了目标投影语料库的问题,这是一个土耳其叙事数据集,其场景携带来自基于规则的检测器的每个场景的 Applied_rules 字段,涵盖六种工艺特征——两种禁令(情感标签、明喻)和四种积极技术(物化隐喻、微焦点、时间锚定、气氛矛盾)。报告了三项研究。研究 1 ($n = 120$) 根据方案作者的盲标签对检测器进行评分。研究 2($n = 100$,不相交的场景集)对检测器加上 Gemini 2.5 Flash 和 Grok 与独立的非专家评分者进行评分,该评分者的标签在任何机器运行之前都被锁定。研究 2b 使用 Claude Fable 5(高)和 ChatGPT 5.5 重新运行相同的协议。核心结果涉及一项规则。在物化隐喻上——最接近该方法的理论核心——五台机器贴标机在 100 美元的场景中返回了 0 美元、1 美元、40 美元、72 美元和 78 美元的正率,而人工计数为 9 美元。对于六个贴标者中的五个来说,科恩的 $κ$ 是随机的或无法区分,跨越人类参考和两个场景集:$0.004$、$0.015$、$0.000$、$0.019$、$0.027$。原始协议范围从 $74.7\%$ 到 $84.5\%$,这是阶级不平衡的产物,而不是能力的标志。我们故意不将其分解为一个故事。有两个解读幸存下来:该功能确实是推理性的,超出了当前的自动检测范围,或者该规则的定义还不足以让任何评估者(包括人类)一致地应用。区分它们需要第二个独立的人类评估员,但本报告没有,因此没有声称。