论文

证据先于规划:技能蒸馏的在线轨迹验证

Evidence Over Plans: Online Trajectory Verification for Skill Distillation

智能体系统Agent Skills

摘要

通过使用人工编写的程序文档,智能体技能可以显着提高任务成功率,但如果没有基于环境的验证,其质量很难评估。现有的技能生成方法严重依赖于偏好日志,而不是直接的环境交互,通常产生的收益可以忽略不计,甚至降低。我们认为这是一个基本的时间瓶颈:强大的技能应该是基于后验的,从经验环境交互而不是先前的计划中提炼出来。在本研究中,我们引入了后蒸馏指数(PDI),这是一种轨迹级指标,用于量化蒸馏技能在任务环境证据中的扎根程度。为了实施 PDI,我们提出了 SPARK(用于自主运行任务和技能生成的结构化管道),用于保留任务执行证据以实现完整的轨迹级分析。 SPARK 生成用于计算 PDI 的经过环境验证的轨迹,并将 PDI 用作在线诊断和干预信号,以确保后技能的形成。在 86 个可运行任务中,SPARK 生成的技能始终超越无技能基线,并且在学生模型上优于人工编写的技能(推理成本比教师模型便宜 1,000 倍)。这些发现表明,PDI 引导的蒸馏可以产生基于任务与环境交互的高效且可转移的技能。我们在 https://github.com/EtaYang10th/spark-skills 发布了我们的代码。

证据先于规划:技能蒸馏的在线轨迹验证:论文配图
图 1:基于 PDI 的 SPARK 示意图。 1) 左(技能生成):从任务描述开始,教师代理(例如 Claude Opus 4.6)与 Docker 化环境交互(最多 NmaxN_{\max} 次尝试),并根据执行反馈更新探索备忘录。成功后,完整的轨迹轨迹将被提取到 SKILL.md 中。一旦发生故障,基于 PDI 的代理就会触发有针对性的干预。 2) 右(任务构建):为了验证技能生成的质量,这是一个支持管道,通过蓝图生成和批评检查将提示转换为经预言机验证的基准实例。然后,学生代理(例如 GPT 5.4 mini)评估这些独立构建的任务所生成的技能,测试基于 PDI 的知识是否跨任务转移,而不是过度拟合教师的原始轨迹。