论文
不同的教师不同的能力:面向结构化文本富化的亚1B端侧蒸馏
Different Teachers, Different Capabilities: Sub-1B On-Device Distillation for Structured Text Enrichment
摘要
大批量结构化抽取为每条内容支付大模型的延迟,把任务蒸馏到小型端侧模型因而有吸引力:以零头时间与成本获得可比输出。我们逐子任务测量该蒸馏实际交付了什么。每篇新闻文章映射到一个JSON对象——含简短摘要与五个分类标签。我们把8B推理教师(deepseek-r1:8b)蒸馏到0.6B学生(Qwen3-0.6B;QLoRA、三种子),并加两个教师对照:同尺寸非推理教师与更大的托管管线。盲法、免参考、三裁判面板对照全文为每个臂打分,另加两个非蒸馏基线——少样本提示与受限解码。学生每篇约0.8秒对教师的39秒,并在摘要质量上恢复基座到教师差距的58%,超其主基线(受限解码)+16.8分、超少样本提示次级+4.9。同尺寸非推理教师训练的学生不优于未调基座——摘要增益源于教师的推理本性而非规模。能力随后按教师分裂:推理教师迁移写作质量、托管管线迁移标签多样性,而同尺寸指令教师的学生在93项测试集的22篇短薄源文章上更锚定(74对55忠实)——推理谱系学生在此捏造。该锚定差异是一致排序而非显著聚合效应,子组小,故报告为方向。因为没有单一引擎在每个字段胜出,交付物是端侧富化的逐字段路由图。
