论文

Pioneer Agent:生产环境中小语言模型的持续改进

Pioneer Agent: Continual Improvement of Small Language Models in Production

智能体系统Agent 架构与控制循环

摘要

小语言模型因成本低、推理快、易于专用化而对生产部署颇具吸引力。然而,将它们适配到特定任务仍是一个充满挑战的工程循环,其驱动因素并非训练本身,而是围绕训练的各项决策:数据筛选、失败诊断、回归避免与迭代控制。我们提出Pioneer Agent,一个将这一生命周期自动化的闭环系统。在冷启动模式下,仅凭一段自然语言任务描述,该智能体即可获取数据、构建评估集,并通过联合优化数据、超参数与学习策略来迭代训练模型。在生产模式下,面对带有已标注失败的已部署模型,它会诊断错误模式、构建针对性训练数据,并在显式的回归约束下进行再训练。为评估这一设定,我们提出AdaptFT-Bench,一个由噪声逐步递增的合成推理日志构成的基准,旨在测试完整的适配闭环:诊断、课程合成、再训练与验证。在涵盖推理、数学、代码生成、摘要与分类的八个冷启动基准上,Pioneer Agent较基础模型提升1.6-83.8分。在AdaptFT-Bench上,它在全部七个场景中都提升或保持了性能,而朴素的再训练最多会退化43分。在两个由公开基准任务构建的生产式部署中,它将意图分类从84.9%提升到99.3%,将Entity F1从0.345提升到0.810。除性能提升外,该智能体还常常纯粹从下游反馈中发现有效的训练策略,包括思维链监督、任务特定优化和以质量为中心的数据筛选。

Pioneer Agent:生产环境中小语言模型的持续改进:论文配图
图 1:Pioneer Agent 系统架构。协调器 LLM (Claude Sonnet 4.6) 驱动 LangGraph 状态机,协调任务分析、数据管理、训练和评估。冷启动模式(左)从任务描述开始;生产模式(右)使用判断的推理轨迹。两者都在训练管道 π=(D,H,S)\pi=(D,H,S) 上共享代理引导的迭代搜索,并在选定的运行(例如 ARC-Challenge)中使用显式图结构 MCGS,并使用 Tinker SDK 在 Modal 沙箱中执行。