论文
用于少镜头文本分类的 LLM 生成样本的几何过滤
Geometric Filtering of LLM-Generated Samples for Few-Shot Text Classification
摘要
大语言模型 (LLM) 可以生成用于文本分类的合成训练数据,但生成的样本质量参差不齐:有些落在嵌入空间的正确类别区域,而另一些则落在外围或跨类别区域。我们提出了一个几何过滤框架,通过与句子嵌入空间中真实类示例的欧几里德距离来评估每个 LLM 生成的样本,仅选择几何一致的候选者。软加权机制将过滤器分数转换为样本权重以进行分类器训练。通过对 13 个数据集、5 个分类器、10 种增强方法和 6,700 多种配置进行评估,我们的方法比 SMOTE 提高了 2.61 个百分点 (pp)($p<0.0001$,Cohen 的 $d=0.95$,胜率 88.9%)。该方法可推广到命名实体识别(+9.26pp,100% 胜率),无需修改过滤器,并且在来自 4 个提供商的 5 个 LLM 中具有稳健性。一个重要的发现是,最简单的基于距离的过滤器始终优于复杂的多标准替代方案。