论文

SKILL-KD:面向LLM智能体的对比式技能蒸馏

SKILL-KD: Contrastive Skill Distillation for LLM Agents

模型优化智能体系统Agent Skills蒸馏

摘要

基于技能的提示已成为改进大语言模型(LLM)智能体的实用机制,但现有技能获取方法常把技能当作经验总结、记忆条目或对成功示范的直接总结。这给较弱的学生智能体造成错配:当学生因缺乏任务知识或操作策略而失败时,其失败轨迹可能不包含足以推断缺失行为的证据,而教师轨迹又可能过于隐式,难以内化为可复用的指导。我们提出SKILL-KD,一个把技能视为不同能力智能体之间显式蒸馏介质的对比式技能蒸馏框架。给定一个学生失败案例及教师在同一任务上的轨迹,SKILL-KD将二者可行动的差异蒸馏为文本技能补丁(skill patch),通过重新运行学生来评估补丁,并在学生仍然失败时迭代精化补丁。为防止重复的局部更新造成技能漂移,SKILL-KD进一步维护与轨迹关联的编辑历史,并执行漂移感知的技能整合(Drift-Aware Skill Consolidation),决定每个补丁应新增规则、删除或修改现有规则,还是被跳过。在五个智能体基准和两种学生设置上,SKILL-KD持续改进冻结的学生智能体,优于固定模型适应基线。

SKILL-KD:面向LLM智能体的对比式技能蒸馏:论文配图
图1:SKILL-KD通过自适应技能蒸馏和漂移意识技能巩固克服自我体验不足和隐性教师演示,以文本技能作为蒸馏媒介来弥合师生能力差距。