论文
SRJudge:通过选择性推理为大语言模型提供细粒度知识概念标记
SRJudge: Empowering Large Language Models with Selective Reasoning for Fine-Grained Knowledge Concept Tagging
摘要
知识概念标签旨在为教育内容分配特定的概念或主题标签,这对于传统和在线教学实践中的教育者和学习者都至关重要。最近的工作已经探索了用于此任务的大语言模型(LLM),并取得了可喜的性能。然而,由于决策空间的高维度,大语言模型仍然难以从大规模候选集中选择正确的概念。在本文中,我们提出了一种新颖的三阶段选择-推理-判断(SRJudge)框架,该框架使大语言模型具有细粒度知识概念标记的选择性推理能力。具体来说,第一阶段的选择器首先通过微调小语言模型(SLM)(例如 BERT)将候选概念缩小到 top-K 候选列表,因为在大多数情况下 top-$K$ 预测命中了正确的概念,从而减少了正确候选者的决策空间。接下来,第 2 阶段 Reasoner 采用轻量级 LLM 对入围候选人进行精细推理。它进一步将改进的强化学习策略与动态特定任务奖励函数和修剪机制相结合,以更好地符合人类推理偏好。最后,一个更大的LLM充当评判者,评估推理过程及其解释的整体合理性,以确定最终的输出。此外,我们构建了两个高质量的数据集以供进一步验证,即生物学数据集 S_Bio 和物理数据集 S_Phy。实验结果表明,我们的方法在基准数据集上始终优于最先进的基线,验证了其有效性和优越性。资源可在:https://github.com/Nicozwy/SRJudge.