论文
Pioneer Agent:生产环境中小语言模型的持续改进
Pioneer Agent: Continual Improvement of Small Language Models in Production
摘要
小语言模型因成本低、推理快、易于专用化而对生产部署颇具吸引力。然而,将它们适配到特定任务仍是一个充满挑战的工程循环,其驱动因素并非训练本身,而是围绕训练的各项决策:数据筛选、失败诊断、回归避免与迭代控制。我们提出Pioneer Agent,一个将这一生命周期自动化的闭环系统。在冷启动模式下,仅凭一段自然语言任务描述,该智能体即可获取数据、构建评估集,并通过联合优化数据、超参数与学习策略来迭代训练模型。在生产模式下,面对带有已标注失败的已部署模型,它会诊断错误模式、构建针对性训练数据,并在显式的回归约束下进行再训练。为评估这一设定,我们提出AdaptFT-Bench,一个由噪声逐步递增的合成推理日志构成的基准,旨在测试完整的适配闭环:诊断、课程合成、再训练与验证。在涵盖推理、数学、代码生成、摘要与分类的八个冷启动基准上,Pioneer Agent较基础模型提升1.6-83.8分。在AdaptFT-Bench上,它在全部七个场景中都提升或保持了性能,而朴素的再训练最多会退化43分。在两个由公开基准任务构建的生产式部署中,它将意图分类从84.9%提升到99.3%,将Entity F1从0.345提升到0.810。除性能提升外,该智能体还常常纯粹从下游反馈中发现有效的训练策略,包括思维链监督、任务特定优化和以质量为中心的数据筛选。
