论文
何时更大才有用?关于大语言模型规模与本体学习的受控研究
When Does Bigger Help? A Controlled Study of LLM Scale for Ontology Learning
摘要
大语言模型(LLM)规模对本体学习(OL)性能的影响仍未得到充分表征。我们使用 OntoLearner 检索增强生成管道,对涵盖 Qwen3.5 和 Qwen3.6 谱系的密集变体和专家混合变体的 13 个模型以及专有的 GPT 发布变体进行了受控评估。所有模型都使用相同的嵌入模型、检索配置、提示模板、解码设置、数据集和术语输入、分类发现和非分类关系提取的度量来评估,涵盖四个生物医学和材料科学与工程本体。在密集的 Qwen3.5 谱系中,增加参数数量主要提高精度而不是召回率,最大增益发生在 9B 和 27B 参数之间。然而,规模效应在任务和领域之间既不是单调的,也不是统一的。密集 27B 模型在术语输入方面优于较大的稀疏模型,而较大的专家混合模型在分类发现方面实现了最强的开放权重结果。跨模型尺度的非分类关系提取仍然很困难,特别是对于材料数据科学本体而言。匹配的 Qwen 变体和专有 GPT 版本之间的性能差异进一步表明架构和模型谱系可能超过标称参数数量。这些发现表明,仅模型大小不足以作为 OL 的选择标准,并为可重复的LLM辅助本体工程提供经验指导。