论文
用于专利匹配的自知识检索增强生成框架
Self-Knowledge Retrieval Augmented Generation Framework for Patent Matching
摘要
基于大语言模型(LLM)的专利检索和匹配在知识产权保护中发挥着至关重要的作用。然而,由于专利文献结构复杂、技术术语密集、信息多模态,传统方法难以准确识别专利之间的细微差异。现有的基于 LLM 的专利匹配方法通常依赖于特定领域的预训练或指令调整,这通常会带来高昂的手动标记成本和灾难性的遗忘。虽然检索增强生成(RAG)方法引入了外部知识,但它们无法充分利用 LLM 自动解析专利和挖掘深层语义关系的能力。为了解决这些限制,本文提出了一种自知识RAG框架,指导LLM从专利匹配查询中自主提取关键技术实体并构建分层本体结构,从而实现查询扩展和精确检索。该方法将FAISS检索与生成匹配机制相结合,利用自知识增强模型对专利创新的理解,显着提高检索和匹配的准确性。实验结果证明了该方法在现实世界专利数据集上的出色性能,验证了其有效性和应用潜力。