论文
专利嵌入基准测试:对 22 个模型进行检索、分类和聚类的多任务评估
Benchmarking Patent Embeddings: A Multi-Task Evaluation of 22 Models Across Retrieval, Classification, and Clustering
摘要
关于从业者使用专利嵌入的两个问题出现:(i) 一个 微调 配方是否足以满足所有下游应用? (ii) 某一专利领域的 微调 是否足以用于其他领域的下游应用?通过对 113,148 项 WIPO 辅助技术专利(46,069 项引文查询)和外部 DAPFAM 数据集对信息检索、分类和聚类这三项任务上的 22 个预训练嵌入模型(参数范围从 22M 到 12B 不等)进行评估,我们发现两个结果对普遍观点提出了质疑。 (i) 最佳 微调 配方取决于下游任务:横截面对齐(配方 R3)为检索性能提供了最大的改进(+7.1% nDCG@10),而组合信号配方(配方 R4)更适合分类(+7.1 F1)和聚类(+10.9 V-measure);匹配的数据控制确认训练数据集大小的差异不是影响因素。 (ii) 单景观 微调 阻碍跨景观信息检索:一种景观上的 微调 显着降低了 DAPFAM 语料库上 8 个模型-配方组合中的 5 个的跨域检索,其中较强的零样本模型受到的影响最大。虽然族内缩放是一致的(Qwen3 0.6B->4B->8B;Llama-Nemotron 1B->8B),但跨族缩放是不稳定的;在前缀修改之后,12B KaLM-Gemma3 在 TAC 检索性能方面排名第 8。标题+摘要+声明是普遍存在的最佳文本视图,所有模型的域内和域外性能之间存在 55-65% 的差距,而这种差距无法通过混合 BM25 密集融合来缓解。代码和评估框架是公开的。