论文

UCOB:经信用感知同策略双向自蒸馏学习利用与演化智能体技能

UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation

模型训练上下文与知识智能体系统强化学习记忆Agent SkillsAgentic RLAgent记忆

摘要

技能记忆可通过将既往经验复用为文本指导来改善智能体强化学习,但检索到的技能不是神谕:在同一状态有帮助的技能可能在另一状态误导同一策略。这使常见的特权教师假设脆弱——把有技能提示当作无技能提示的固定教师。我们引入UCOB:经信用感知同策略双向自蒸馏学习利用与演化智能体技能的框架。UCOB把有技能与无技能提示当作同一模型的两个同策略上下文视图,在同一任务与锚状态内比较其回报走向,以更高回报的视图作局部教师。这一局部信用信号内化有用的技能条件行为、纠正误导性的技能使用、并指导任务/状态技能记忆更新、效用感知检索与反思自训练。ALFWorld、WebShop与Search-QA上的实验显示:UCOB在跨模型规模上超越免技能RL、技能记忆基线与自蒸馏方法——ALFWorld与WebShop上较SOTA基线分别提升23.5分与18.0分。

UCOB:经信用感知在策略双向自蒸馏学习利用与演化智能体技能:论文配图
图 1:UCOB 的概述和实证总结。