论文
BoostTaxo:通过增强型代理推理和约束感知校准进行零样本分类归纳
BoostTaxo: Zero-Shot Taxonomy Induction via Boosting-Style Agentic Reasoning and Constraint-Aware Calibration
摘要
分类归纳对于将概念组织成明确且可解释的语义层次结构至关重要。虽然现有方法取得了有希望的结果,但它们的泛化性、结构可靠性和效率仍然有限,阻碍了它们在零样本和大规模场景中的性能。为了克服这些限制,我们引入了 BoostTaxo,这是一种用于零样本分类归纳的提升式 LLM 框架。它以一组领域术语作为输入,并以从粗到细的方式执行父级识别,采用检索增强定义细化、混合父级候选选择、候选评级和结构感知分数校准来改进分类法构建。具体来说,轻量级的LLM用于有效过滤候选父节点,而大规模的LLM用于对候选父节点进行排名和评分,以进行细粒度的父节点选择。进一步结合结构特征来校准候选边缘权重并增强诱导分类的可靠性。统一的 BoostTaxo 在三个公共基准数据集(即 WordNet、DBLP 和 SemEval-Sci)上进行评估,并在零样本分类归纳中实现了优于或与最先进的方法相当的性能。消融研究验证了混合父代候选选择和结构感知分数校准对整体性能的贡献。进一步的分析调查了候选选择大小对分类质量的影响,并提出了代表性案例和失败研究,为所提出的框架的有效性和局限性提供了更深入的见解。