论文
Baszta:以数据为中心微调波兰语多标签安全分类器
Baszta: Data-Centric Fine-Tuning of a Polish Multi-Label Safety Classifier
摘要
我们通过以Focal + R-Drop目标微调allegro/herbert-base-cased(124M),开发了一个覆盖五类(仇恨、粗俗、色情、犯罪、自残)的波兰语多标签内容安全分类器,并在共享的分布外Gadzi Język基准上与Bielik Guard(Sójka)进行评测。两个系统在同一校准集上进行按类别的阈值调优。在该匹配协议下,我们的模型在micro F1上保持小幅但统计显著的领先,而表面上macro-F1的领先未能保持:那是把调优模型与未调优模型相比较产生的伪影。我们还报告了micro这一数字的真正价值。由于Gadzi Język有97%为犯罪正例,一个对所有输入都标记犯罪、其余不标的分类器在同一测试集上已能得到0.910的micro F1,因此micro无法把系统与退化策略区分开,macro才是有效的列。按类别和按协议的数字见第4节。剩余的分布外差距是校准问题而非判别问题。排序质量保持高位而正例概率坍缩,按类别的温度缩放能在Platt缩放和保序回归失效之处恢复损失。这种恢复依赖于校准集包含安全文本。Gadzi Język几乎不含安全文本,因此在其上拟合的阈值会对每个安全输入标记犯罪,平衡重拟合以牺牲对抗召回为代价换来可部署的工作点。我们同时报告两个工作点,而不只报好看的那个。两项标准做法——按类别的代价敏感加权和均值池化——各自提升分布内macro F1却降低分布外表现,这说明鲁棒性必须被直接选择,而不能从分布内精度中继承。
