论文
SkillOpt:自演化智能体技能的执行策略
SkillOpt: Executive Strategy for Self-Evolving Agent Skills
摘要
如今的智能体技能要么手工编写,要么一次性生成,要么经由松散控制的自我修订演化而来,没有一个表现得像技能的深度学习优化器,也没有一个能在反馈下可靠地超越起点。我们主张,技能应改为作为冻结智能体的外部状态来训练,并遵循使权重空间优化可复现的同样纪律。据我们所知,SkillOpt是首个系统化、可控的文本空间智能体技能优化器:由单独的优化器模型将有评分的rollout转化为对单一技能文档的有界增/删/改编辑,且只有当编辑严格提升留出验证分数时才被接受。文本学习率预算、被拒编辑缓冲与按轮次的慢速/元更新使技能训练稳定,同时在部署时不增加任何推理期模型调用。在六个基准、七个目标模型与三种执行环境(直接对话、Codex、Claude Code)上,SkillOpt在全部52个(模型、基准、执行环境)单元中最优或并列最优,并在每个单元上都胜过人工、一次性LLM、Trace2Skill、TextGrad、GEPA与EvoSkill等技能方案。在GPT-5.5上,它将无技能平均准确率在直接对话中提升+23.5分,在Codex智能体循环中提升+24.8分,在Claude Code中提升+19.1分。迁移实验进一步表明,优化后的技能产物在跨模型规模、在Codex与Claude Code执行环境之间、以及在不进一步优化的情况下迁移到邻近数学基准时,仍保持价值。代码:https://aka.ms/skillopt
