论文

从打分到行动:面向LLM智能体的结果验证式比较自蒸馏

From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents

模型优化模型训练强化学习蒸馏Agentic RL

摘要

近期关于LLM智能体的研究正从外部能力引出转向能力内化,使智能体在推理时无需检索即可保留有用技能。同策略自蒸馏(OPSD)提供了一个有前景的方向,但许多现有方法通常通过沿学生生成的轨迹对动作打分来监督学生。这类监督有两个局限:教师偏好未经环境结果验证,且动作级评分未能充分利用来自学生rollout、教师rollout及其行为关系的信息。因此,我们主张经过结果验证的教师监督,以及在教师-学生轨迹之上进行比较学习。基于这一观点,我们提出结果验证式比较自蒸馏(OVCSD)。OVCSD将失败的学生rollout组织成前缀树,从学生到达的状态出发自适应地调用技能条件化的教师,并只保留经过结果验证的成功续写。随后,它在第一个状态对齐的分歧点处应用局部化的比较学习,并蒸馏分歧后的教师后缀以迁移完成行为。在ALFWorld和WebShop上跨三个模型规模的实验表明,OVCSD持续优于无技能强化学习和现有自蒸馏基线,在ALFWorld和WebShop上分别相对最强基线取得最高29.7和5.4个百分点的绝对成功率提升,同时训练期间增加的特权交互不足3%。

从打分到行动:面向LLM智能体的结果验证式比较自蒸馏:论文配图
图 1:对 ALFWorld 和 WebShop 的初步观察。 (a) 全失败组的频率。 (b) 这些组内的共享前缀覆盖。 (c)最大共享前缀深度DmaxD_{\max}的生存曲线。 (d) 第一次分歧处技能条件似然排序的准确性(最小行动支持 n=1,2,3n=1,2,3 的 0.5150.515、0.4430.443、0.3720.372;虚线表示机会)。