论文
大规模语法概念注释:部署的微调小语言模型优于提示的前沿模型
Grammar Concept Annotation at Scale: Deployed Fine-Tuned Small Language Models Outperform Prompted Frontier Models
摘要
纠正反馈是第二语言习得最明显的驱动因素之一,但课堂上提供的纠正很少能积累成语法掌握的可行观点。提示前沿模型可以从学习者-导师的课程记录中提供这样的观点,但它们的规模成本很高。我们通过在过滤和重新平衡的教师生成监督上微调 Qwen3.5 小语言模型 (SLM),然后在我们平台上所有英语学习者的端到端语法掌握跟踪器中部署高效的 0.8B 模型来缩小这一差距。将注释契约内部化到适配器权重中可以将 0.8B 模型与紧凑的匹配提示而不是冗长的指令配对。在两个人工策划的基准测试中,部署的 0.8B 模型和 4B 参考比较器均优于 GPT-5.4 和 GPT-5.6 Sol,在日益严格的嵌套匹配标准(概念、证据广度和正确性)下,GPT-5.4 和 GPT-5.6 Sol 在精确度和召回率方面表现出色。部署的 0.8B SLM 可将服务成本降低约 16$\times$。特征级在线实验显示显着 学习者参与度 ($+15.8\%$) 和关键业务指标的收益,包括预定时间 ($+2.1\%$) 和新课程的 GMV ($+13.2\%$)。