论文

学生引导教师蒸馏的LLM任务路由

Student-Guided Teacher Distillation for Efficient LLM Task Routing: Positioning Against Jev-Style System-1 Classifiers

AI 基础设施模型网关

摘要

零样本分类器可用于把用户请求路由到专门LLM任务,但对大候选集逐一打分代价高:零样本NLI分类器每个标签要评估一对前提-假设,成本随分类体系规模线性增长。我们研究面向60类LLM任务固定分类体系的学生引导教师蒸馏管道:紧凑的ModernBERT分类器单次前向预测完整类别分布并检索小规模top-k候选集,更大的DeBERTa-v3零样本NLI分类器只对候选而非全部60标签重排;所得教师标签迭代改进学生,使其为下一轮产生更锐利的候选。与极限多标签分类中的通用嵌入检索或聚类候选不同,我们的候选生成器在目标分类体系上端到端训练且就是服务生产流量的同一模型——这既不同于在候选模型间路由的LLM路由工作,也不同于训练方法未公开或基于RL的同期System-1编码器分类器(如TypeSafe AI的Jev与开源Laya项目)。最佳学生检查点在200例评估集上达到77.5%教师一致率,初步覆盖测量显示Coverage@16为91-100%,说明top-k集保留了教师决策相关信息的绝大部分。我们进一步表明截断的top-k教师分数不应被当作完整60类软目标做KL蒸馏:把未截断类清零会破坏软标签蒸馏依赖的暗知识,引入系统偏差而非无害稀疏近似。含多k覆盖、嵌入检索基线与更大人工审核测试集的完整评估仍在进行。