论文

Baszta:以数据为中心微调波兰语多标签安全分类器

Baszta: Data-Centric Fine-Tuning of a Polish Multi-Label Safety Classifier

模型评测鲁棒性、公平性与可信度评测

摘要

我们通过以Focal + R-Drop目标微调allegro/herbert-base-cased(124M),开发了一个覆盖五类(仇恨、粗俗、色情、犯罪、自残)的波兰语多标签内容安全分类器,并在共享的分布外Gadzi Język基准上与Bielik Guard(Sójka)进行评测。两个系统在同一校准集上进行按类别的阈值调优。在该匹配协议下,我们的模型在micro F1上保持小幅但统计显著的领先,而表面上macro-F1的领先未能保持:那是把调优模型与未调优模型相比较产生的伪影。我们还报告了micro这一数字的真正价值。由于Gadzi Język有97%为犯罪正例,一个对所有输入都标记犯罪、其余不标的分类器在同一测试集上已能得到0.910的micro F1,因此micro无法把系统与退化策略区分开,macro才是有效的列。按类别和按协议的数字见第4节。剩余的分布外差距是校准问题而非判别问题。排序质量保持高位而正例概率坍缩,按类别的温度缩放能在Platt缩放和保序回归失效之处恢复损失。这种恢复依赖于校准集包含安全文本。Gadzi Język几乎不含安全文本,因此在其上拟合的阈值会对每个安全输入标记犯罪,平衡重拟合以牺牲对抗召回为代价换来可部署的工作点。我们同时报告两个工作点,而不只报好看的那个。两项标准做法——按类别的代价敏感加权和均值池化——各自提升分布内macro F1却降低分布外表现,这说明鲁棒性必须被直接选择,而不能从分布内精度中继承。

Baszta:以数据为中心微调波兰语多标签安全分类器:论文配图
图 1:四个经污染审计的公开基准上的留出性能。所有系统都在经过相同精确文本过滤后的同一批数据行上打分,使用相同的任务到评测头映射,并采用在同一平衡 sojka_val 数据源上拟合的按类别阈值,因此不存在调优系统与未调优系统之间的不公平比较。左图:F1,越高越好。右图:各基准自身负类上的假阳性率,越低越好,虚线标出同一工作点在真正安全文本上取得的 5.5% 比率。两幅面板需要结合起来看:左边的高柱配上右边的高柱,意味着召回率是以假阳性为代价换来的。