论文
KbSD:用于代理搜索中行为校准的知识边界感知 Self-蒸馏
KbSD: Knowledge Boundary aware Self-Distillation for Behavioral Calibration in Agentic Search
摘要
代理搜索为 大语言模型 配备了动态检索能力,但现有的强化学习方法仍然受到知识边界校准中奖励稀疏性的限制——决定何时信任参数记忆,何时依赖检索到的证据,何时放弃。二元奖励可以惩罚不良结果,但对跨不同知识状态做出校准决策所需的推理过程提供很少的指导。为了解决这个问题,我们提出了 KbSD(知识边界 Self-蒸馏),这是一个通过密集 词元级 监督、结果级稀疏奖励和象限自适应优化来解决这一限制的框架。 KbSD 构建了一个提示增强教师,其架构与学生相同,接收明确的知识边界信号(包括参数确定性、检索质量和 真值 答案)以生成校准的推理演示。这种信息不对称的自 蒸馏 可以实现密集监督,而不需要更大的外部模型。为了进一步解释跨知识状态的异构推理分布,我们引入了象限自适应 蒸馏 目标:用于集中集成的反向 KL,用于多样化拒绝的正向 KL,以及用于需要精度和覆盖范围的非对称象限的帕累托最优双向 KL。多个基准的实验表明,KbSD 在强基线上持续提高了任务准确性和幻觉缓解能力,最大的收益出现在稀疏奖励信息量最少的具有挑战性的象限中。