论文
CompOrca:指令调优数据的语料库规模合规性标签
CompOrca: Corpus-Scale Compliance Labelling of Instruction-Tuning Data
摘要
研究如何微调拒绝和不遵守行为需要识别拒绝、逃避或以其他方式无法完成所要求任务的训练示例。但现有的注释最多涵盖几千个提示的评估集。我们推出了 CompOrca,这是一个针对整个 4,233,923 个示例 OpenOrca 语料库的合规性标签。每个示例均由开放权重 LLM 评审(LongCat-2.0,1.6T 参数)的五次独立通过分类为合规或不合规,并且语料库随原始投票计数一起发布为一致合规(94.75%)、一致不合规(1.28%)和不一致行(3.97%)。单次传递将 2.7-3.2% 的语料库标记为不合规,而只有 1.28% 的语料库被所有五个标记为不合规,从而允许过滤最模糊的样本。针对 450 个人工注释的示例,其中 150 个注释了两次(人与人 $κ= 0.93$),一致的合规性和不合规性标签的精确度分别为 97.3% 和 86.7%,后者是不合规性的高精度子集,而不是完整的枚举。已发布的拒绝检测方法只能召回 0.4% 至 94.1% 的不合规类别。我们在 https://huggingface.co/datasets/cemiu/CompOrca 发布了完整的语料库及其每行标签和投票计数