论文
STAR:面向超小型函数调用模型的相似度引导教师辅助精炼
STAR: Similarity-guided Teacher-Assisted Refinement for Super-Tiny Function Calling Models
摘要
大语言模型(LLM)在函数调用中的普及对构建先进的AI智能体至关重要,但其庞大规模阻碍了广泛采用,因而需要将其能力迁移到更小的模型中。然而,现有范式常受困于过拟合、训练不稳定、对多解任务无效的二值奖励,以及多种技术难以协同。我们提出STAR(Similarity-guided Teacher-Assisted Refinement,相似度引导的教师辅助精炼),一个能有效将LLM能力迁移到超小型模型的新型整体框架。STAR包含两项核心技术创新:(1)约束知识蒸馏(Constrained Knowledge Distillation,CKD),一种对top-k前向KL散度进行增强的训练目标,用于抑制自信但错误的预测,在为下游RL保留探索能力的同时确保训练稳定性;STAR在一个连贯的训练课程中整体协同这些策略,使超小型模型在复杂函数调用任务上取得卓越表现;(2)相似度引导RL(Sim-RL),一种引入细粒度、基于相似度奖励的RL机制,通过评估生成输出与真值之间的相似度,为更优的策略优化提供稳健、连续且丰富的信号。在富有挑战性且知名的基准上进行的大量实验证明了我们方法的有效性。我们的STAR模型在其尺寸级别中确立了SOTA,显著超越基线。值得注意的是,我们的0.6B STAR模型在所有1B以下开源模型中取得最佳表现,甚至超过多个更大规模的知名开源模型。STAR展示了一种将LLM能力蒸馏到超小型模型的训练框架,为强大、易得且高效的AI智能体铺平道路。
