论文
当审计质量无法预测下游效用时:针对资源匮乏的非洲 NLP 的合成数据选择器的反事实研究
When Audit Quality Fails to Predict Downstream Utility: A Counterfactual Study of Synthetic-Data Selectors for Low-Resource African NLP
摘要
质量意识的合成数据选择依赖于代理:大语言模型判断评级良好的示例也应该有助于下游模型学习。在低资源非洲语言分类的受控重播中,我们表明该代理崩溃了。在四种语言(阿姆哈拉语、豪萨语、斯瓦希里语、约鲁巴语)、两个分类任务(MasakhaNEWS、AfriSenti)和五个匹配预算选择器中,审计排名和下游排名存在差异。在每个单元格内,判断的标签正确性与选择器之间的 Macro-F1 之间的 Spearman 平均值为 $ρ{=}0.04$(中位数 $0.00$),表明不匹配不是聚合伪影。我们的反事实审计框架 \method{}-V2 可以同时在三个审计通道上生成最干净的选定池:最高的判断标签正确性($0.904$ vs.\ $0.767$ 为 naive,$17.9\%$ 相对增益),最低快捷得分,以及 $0.162$ 与 $0.486$ 为 naive 的硬拒绝率。尽管如此,AlpaGasus 仍领先下游 Macro-F1(\method{}-V2 为 $0.202$ vs.\ $0.163$),并且反转在五个非简并单元上持续存在。这个教训是方法论上的:在这种受控环境中,审计质量是所选池的属性,而不是下游效用的保证。因此,综合数据评估应报告同一保留集的审计和下游指标。我们发布审计表、每个选择器保留池以及将每个报告的数字链接到其源行的索赔分类账。