类结构保留击败多样性:不平衡文本分类的文本增强方法的综合基准
Class-Structure Preservation Beats Diversity: A Comprehensive Benchmark of Text Augmentation Methods for Imbalanced Text Classification
摘要
随着大语言模型(LLM)的快速发展,生成数据增强对于自然语言处理中不平衡的文本分类引起了相当大的关注。然而,迄今为止,还没有经验基准将基于 LLM 的增强与嵌入空间 SMOTE 式检索 (EmbSMOTE) 进行比较,嵌入空间 SMOTE 式检索 (EmbSMOTE) 是不平衡分类的强大经典参考。在这项研究中,在七个公共文本分类数据集上新构建了 11 种增强方法的受控基准,涵盖经典扰动、嵌入空间检索和基于 LLM 的生成,涵盖类计数 $K=2$-$28$ 和 1.1 至超过 500 的不平衡比,并使用宏 F1、Welch 的 $t$ 测试、五个分布指标和每个单元格的五个随机种子进行评估。 LLM-基于Qwen3-8B的家族敏感性分析。实验结果表明,所有基于 LLM 的方法在统计上与 EmbSMOTE 相当或较差,随着不平衡的增加,性能差距单调扩大,并在 GoEmotions-28 上达到 $Δ\text{F1}_\text{macro}\!\approx\!0.063$。此外,据观察,表面级唯一性与下游性能的相关性可以忽略不计,而 LLM 特定的工件(例如文本延长和标签分布均匀化)与分类精度负相关。与六个基于 LLM 的基线和四个经典的增强基线相比,这些结果表明,有效变量不是表面水平多样性,而是类条件结构保真度,即增强样本保留训练分布的类条件几何形状的程度。因此,应该采用基于检索的过采样作为不平衡多类分类的默认设置,并且在实践中部署基于 LLM 的增强之前应该需要更高的经验标准。