论文
pro-team在LLMs4OL 2026旗舰任务与复用任务上的方案:面向本体学习的检索增强生成与词表约束过滤
pro-team at LLMs4OL 2026 Tasks Flagship and Reuse: Retrieval-Augmented Generation and Vocabulary-Constrained Filtering for Ontology Learning
摘要
尽管大语言模型(LLM)进展显著,从文本中进行本体学习仍然充满挑战:LLM可能产生领域术语幻觉、输出格式不一致,并且偏向层级关系而非关联关系。在LLMs4OL 2026挑战赛中,我们使用离线检索增强的少样本提示流水线,同时应对端到端旗舰任务(Task A)与本体扩展复用任务(Task B)。我们的系统采用Qwen2.5-14B-Instruct,配合all-MiniLM-L6-v2进行示例检索,为Task A选择top-5示例,为Task B选择top-2示例。左截断的上下文窗口策略在长提示中保留任务指令。对于Task B,生成的三元组经过确定性的词表约束过滤:当三元组至少有一个端点属于样本的封闭术语/类型词表时予以保留,并去除与初始本体重复的三元组。该方法在Task B上取得0.8692的语义图相似度、0.9200的术语类型判定F1和0.8540的分类体系发现F1,Task A取得0.7416的语义图相似度。然而,系统未抽取到任何非分类关系,凸显了封闭且面向分类体系的关系词表的局限。