论文
从打分到行动:面向LLM智能体的结果验证式比较自蒸馏
From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents
摘要
近期关于LLM智能体的研究正从外部能力引出转向能力内化,使智能体在推理时无需检索即可保留有用技能。同策略自蒸馏(OPSD)提供了一个有前景的方向,但许多现有方法通常通过沿学生生成的轨迹对动作打分来监督学生。这类监督有两个局限:教师偏好未经环境结果验证,且动作级评分未能充分利用来自学生rollout、教师rollout及其行为关系的信息。因此,我们主张经过结果验证的教师监督,以及在教师-学生轨迹之上进行比较学习。基于这一观点,我们提出结果验证式比较自蒸馏(OVCSD)。OVCSD将失败的学生rollout组织成前缀树,从学生到达的状态出发自适应地调用技能条件化的教师,并只保留经过结果验证的成功续写。随后,它在第一个状态对齐的分歧点处应用局部化的比较学习,并蒸馏分歧后的教师后缀以迁移完成行为。在ALFWorld和WebShop上跨三个模型规模的实验表明,OVCSD持续优于无技能强化学习和现有自蒸馏基线,在ALFWorld和WebShop上分别相对最强基线取得最高29.7和5.4个百分点的绝对成功率提升,同时训练期间增加的特权交互不足3%。
