论文
综合数据增强对语篇语用功能分类的影响
The Impact of Synthetic Data Augmentation on Discourse-Pragmatic Function Classification
摘要
合成数据增强已成为解决 NLP 中类别不平衡问题的常见策略,但大多数方法侧重于生成示例的数量和多样性,而不是它们与真实训练数据的几何关系。我们在语篇语用功能分类的背景下研究这个问题,在这项任务中,数据稀疏性是一种结构特征,而不是一个集合人工制品。使用从英国国家语料库中提取的 410 个手动注释的英语单词 Look 实例,涵盖四个功能:注意信号、指令、话语标记和感叹词。我们使用 Llama 3.1 生成合成训练示例,并根据它们与 RoBERTa 嵌入空间中真实训练数据的余弦距离对它们进行分区。我们比较了六种训练条件,这些条件在合成示例相对于经验决策边界的放置方面有所不同,同时保持各条件下的增强量恒定。所有增强条件都比真实基线提高了宏 F 和准确度,但核心近端示例 (NEAR) 在宏 F 中产生了最大增益 (0.113),而距离平衡混合实现了最高准确度 (0.748)。没有任何条件可以改善 AUC,这表明增强会改变决策边界,而不是改善模型的潜在概率估计。这些发现表明,合成示例在表示空间中的位置与生成的示例数量一样重要,这对低资源实用分类具有更广泛的影响。