论文
通过详细的宪法定义和人工智能驱动的评估提高标签一致性
Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation
摘要
许多自动标签管道将输入分类为由书面规范定义的类别,内容审核是一个突出的用例。简单的类别定义不够详细,标签商无法生成这些管道所需的准确、一致的黄金标签。一种解决方案是编写一个规定性定义,解决足够多的实际边界情况,使标签者不能不同意书面解释。在实践中,这种详细程度的定义超出了人类注释者在工作记忆中可以容纳的范围,因此注释者依靠直觉,标签偏离书面规则,从而在准确性和一致性方面出现倒退。我们提出并证明了人工智能驱动的工作流程的功效,其中人工智能帮助编写每个类别的构成,该构成足够详细地定义标签以覆盖边缘情况,并且前沿 LLM 在每个输入上解释它,以比人类阅读同一文档更一致和更准确地生成黄金标签。我们对三个内容审核类别(骚扰、仇恨言论、非暴力犯罪)进行了评估,结果表明,与段落定义相比,该方法将跨模型不一致程度降低了 57 倍,其中跨模型分歧诊断规范差距,并由负责每个类别含义的高层决策的人员负责,而不是单独的标签调用。对于安全性评估,我们引入了双轴公式,在整个对话中独立地对意图和内容进行评分,因此下游消费者可以在任一轴或两个轴上采取行动。