论文
PROOF-Gen:从优化数据到更好的蒸馏
PROOF-Gen: From Optimized Data to Better Distillation
摘要
在教师生成的轨迹上做监督微调,是将工具调用能力蒸馏到可部署模型的标准第一阶段。驱动已上线工具调用智能体的后训练管线以每日或每周的节奏重跑这一阶段,每个周期都支付前沿教师的成本,但其机制是生成并过滤(保留教师通过的轨迹,丢弃其余),且每个周期都会留下同样的困难场景,因为失败不提供信号。在τ2-bench上,57%的教师试验失败,其中三分之二是险些成功(大多数工具调用正确,被一个决定性错误毁掉)。我们提出PROOF-Gen(Per-scenario Reflective Optimization to Overcome Failed Generation),通过逐场景提示优化从这些失败中恢复黄金轨迹。对每个失败任务,反射器分析执行轨迹和评估反馈,然后写出纠正性指导,引导教师产出通过的轨迹。该指导在训练前被剥离,因此学生从干净的演示中学习,没有任务特定的脚手架。在τ2-bench上,逐场景优化恢复了93%的失败场景。在组合数据上微调后,Qwen3-4B-Instruct-2507从Pass^1=0.132提升到0.529,Gemma 4 E4B-it在BFCL v4多轮上提升+7.2pp。在已部署管线中,该方法将目标完成率提升+6.3pp,并迁移到已部署的端侧模型(目标完成率+1.5pp;响应质量指标+1.7至+5.0pp),在每个语言环境都有正向迁移(非英语平均+1.48pp)。