技术实践

1688用Agent自动调参与微调Qwen3

智能体系统模型训练AI 基础设施监督微调与指令调优参数高效训练Agent 架构与控制循环AI 开发与运维平台

概述

1688团队把过去几个月在电商场景做 Qwen3 微调(Query 改写 / 同款判定 / 重排打分)的流水线沉淀成 SKILL.md 交给 Agent 执行:阶段一按 7 维(基座、数据质量、数据规模、Prompt 模板、训练方式、Eval 配置、Baseline 复盘)做场景诊断并锁定基座模型,阶段二从 15+ 技术候选库按六级参数优先级生成改进方案,阶段三每个实验生成 config、push TuningFactory(LLaMA-Factory 内部 Fork)submodule 实验分支、submit.sh 提交到星云训练平台、用 /loop 定时轮询 API 拉日志、正则提取 eval_loss 与 BLEU/ROUGE 写入 experiment_results.csv。 已端到端验证 SFT 全参、SFT LoRA、SFT LoRA MoE、DPO LoRA 与离线数据蒸馏。在线 KD 与 RL/GRPO(接入 ROLL)配置就绪未验证。典型收益:Qwen3 默认 thinking mode 使 predict_bleu-4 只有 1.82,加 --enable_thinking=False 后升至 46.32、rouge-l 63.57。