合成专利数据何时有用?低资源多标签分类中的数量—保真度权衡
When Does Synthetic Patent Data Help? Volume-Fidelity Trade-offs in Low-Resource Multi-Label Classification
摘要
我们研究大语言模型生成的合成数据何时有助于资源匮乏的多标签专利分类,将真正的合成价值与更大的增强集仅凭数量取胜的混乱区分开来。在六个开源大语言模型(3.8-12B)、四个真实数据体系、64 个 WIPO 辅助技术标签、两代策略和三个分类器系列中,专利 BERT 微型 F1 从 0.120 跃升至 0.702 主要是由数量驱动的。重复匹配纯实控件,对 165 项专利进行重新采样,使增强大小达到 0.678;受控合成增益仅比该控制+0.024,但比焦点损失重新加权(最强的非增强基线)高+0.219。主要发现是,保真度指标的含义会随着规模的变化而变化:在极度稀缺的情况下,MMD 与分类增益呈正相关 (r=+0.95),但在 1:10 时,关系发生翻转 (r=-0.73;Fisher z=+6.47,p<0.001)。固定预算混合找到 20-30% 实际/70-80% 合成最佳值;释义缩放从 165 个文档种子开始崩溃;洗牌混合击败了课程排序、集成和基于分类器的过滤。泄漏控制——标签名称屏蔽、指令级标签删除、细粒度评估和关键字重叠审计——反对标签字符串依赖作为 BERT-for-Patents 的主要驱动力。 ModernBERT 在标签删除下的明显崩溃可以追溯到 Flash-Attention-2 + bf16 数值工件,通过 fp32 热切关注恢复了 65% 的性能损失。最后,将分类提高高达 +0.58 原始 micro-F1 的同一语料库会损害 Jaccard 标签重叠检索代理;即使是标准专利过滤器也会留下 26% nDCG@10 的下降。因此,合成专利文本是特定于任务和指标的,不能简化为仅提示类型。
