论文
SCAD:长程智能体的结构化信用分配与蒸馏
SCAD: Structured Credit Assignment and Distillation for Long-Horizon Agents
摘要
训练长程智能体解决复杂任务需要对长交互序列的有效监督。但稀疏的终端奖励掩盖中间贡献,而在线蒸馏会随学生生成历史增长丢失有信息量的教师指导。为此我们提出SCAD:把交互组织为规划与有界子任务执行,在局部上下文中蒸馏执行,并通过跨rollout子任务前缀树细化规划信用——规划获得全部终端信用,执行获得正终端信用与教师指导。跨全部受评基准,SCAD较最强训练基线把文本任务宏平均准确率提升4.48个百分点、多模态任务4.19点。SCAD有效结合基于结果的信用分配与教师引导蒸馏,改善长程智能体的规划与执行。