论文
AUSO:从内化到利用的动作级统一技能优化
AUSO: Action-Level Unified Skill Optimization from Internalization to Utilization
摘要
随着智能体策略的演进,技能扮演着不同的角色:它们首先应提供可学习的知识,继而支撑能力形成,最后只在能改善单个决策时才被调用。现有方法很少建模这一生命周期:要么把技能留在模型之外,要么将其完全内化,要么靠含噪的任务级成功率在内化与利用目标之间做选择。这类设计割裂了训练,并对同一轨迹中的动作赋予同等重要性,尽管技能指导可能有助于某些决策却干扰另一些。为解决这些问题,我们提出AUSO(动作级统一技能优化),通过渐进的、动作感知的优化过程统一技能学习与技能使用。训练初期,AUSO联合学习教师指导与环境结果,使策略在不丢失任务导向反馈的情况下习得基础技能。随后它强调基于结果的策略优化,以巩固自主问题解决能力。当策略成熟后,AUSO在技能条件与无条件两种情境下评估每个采样动作,所得动作级信息信号与轨迹结果优势耦合,让有益的技能敏感动作获得更强更新、有害动作被抑制。由此,技能逐渐从外部监督来源转变为决策知识,其利用随动作级收益自适应调整,而强化学习始终是贯穿各阶段的共享骨干。在ALFWorld、WebShop和SearchQA上的实验表明,AUSO持续优于竞争基线并提升分布外泛化。
