论文
CodeSkill:在潜在技能空间训练长程代码Agent
CodeSkill: Latent Skill Abstraction for Long-Horizon Code Agents
摘要
代码Agent需要对复杂的交互轨迹进行长期决策。然而,现有的强化学习(RL)方法通常会在词元级别优化行为,从而导致低级生成和高级行为推理之间不匹配。这种限制导致奖励稀疏下的探索效率低下和信用分配薄弱。此外,虽然大规模Agent轨迹通常包含重复出现的多步骤行为模式,但它们嘈杂的词元级表示阻碍了有效的经验重用。为了应对这些挑战,我们提出了 CodeSkill,一个将分层潜在技能建模适应代码Agent领域的框架。 CodeSkill 首先利用教师模型将成功和失败的轨迹提炼成多层次的文本抽象。然后,它将时间变分推理与强化学习相结合,将这些离散语义映射到连续的潜在变量,同时自适应边界机制根据执行反馈动态地控制技能转换。学到的技能作为潜在语义前缀注入到冻结的 LLM 策略中,从而能够在紧凑的语义空间而不是原始词元序列上进行优化。通过将强化学习从词元级探索转变为经验级推理,CodeSkill 提高了优化效率和长期行为一致性。大量实验表明,CodeSkill 在各种通用和工业编码基准中相对强大的开放权重基准实现了极具竞争力的性能。此外,所学到的技能表现出强大的可移植性和强大的跨域泛化能力,突出了显式行为抽象对于可扩展的 agentic 代码生成的有效性。