论文

QaECTER与Sophia-Bench:引文驱动的专利嵌入多视图训练

Citation-Driven Multi-View Training for Patent Embeddings: QaECTER and Sophia-Bench

摘要

专利检索支持创新、审查和知识产权策略,但缺少覆盖真实搜索场景多样性的基准。我们提出两项工作。Sophia-Bench包含1万查询与7.5万语料文档,按十年、八个IPC技术部类和12个申请司法辖区分层。它覆盖从结构化专利字段到AI生成摘要的12种查询类型,并结合引文真值与InScope领域相关性指标,衡量不同查询、技术领域与辖区下的表现。QaECTER是一个3.44亿参数的嵌入模型,以专利引文图与多视图自对齐训练。尽管规模较小,它在Sophia-Bench的全部查询类型、IPC部类与辖区上,优于英文检索文本嵌入基准RTEB排名第一且大23倍的模型,以及已有专利专用模型;相对次优模型,平均NDCG@10改善最高7.2%。独立外部基准同样确认其表现,且无需任务特定指令提示。基准与模型面向大规模专利搜索系统的实际使用。