论文

它新颖吗?为什么?基于段落检索的细粒度专利新颖性预测

Is It Novel and Why? Fine-Grained Patent Novelty Prediction Based on Passage Retrieval

模型评测基准与评测资源

摘要

新颖性评估是专利受理审查过程中一项关键而复杂的任务,要求审查员确定一项发明是否在现有技术文件中公开。该过程涉及专利权利要求的具体特征与现有技术中的段落之间的复杂匹配。虽然之前的工作主要将新颖性预测作为权利要求级别的二元分类任务,但我们认为这种公式容易受到虚假相关性的影响,并且缺乏实际应用所需的粒度。在这项工作中,我们介绍了 FiNE-Patents(专利细粒度新颖性审查),这是一个新颖的数据集,包含 3,658 项第一专利权利要求,并用从欧洲检索意见 (ESOP) 文档中提取的细粒度、特征级现有技术参考文献进行注释。我们建议将评估范式从简单的二元分类转变为特征级别的联合检索和抽象推理任务,要求模型识别现有技术文档中公开单个权利要求特征的特定段落,并识别权利要求的哪些特征使其具有新颖性。我们实现并评估基于 LLM 的工作流程,将权利要求分解为特征,根据现有技术分析每个特征,最后得出权利要求级别的新颖性预测。我们的实验表明,这些工作流程在段落检索和新颖特征识别方面优于基于嵌入的基线。此外,我们表明,与经过训练的分类器不同,LLM 对于权利要求级新颖性分类任务中存在的虚假相关性具有鲁棒性。我们发布数据集和代码,以促进对透明和精细专利分析的进一步研究。