论文

SkillLift:从稀疏真值学习密集准则,高效演化技能

SkillLift: Learning Dense Rubrics from Sparse Oracles for Efficient Skill Evolution

智能体系统Agent Skills

摘要

大模型智能体日益依靠持久技能,即可复用程序性提示,在不更新权重下适应。现有技能自演化直接依据执行反馈改写文本,但每次真值评估都需完整智能体运行,监督瓶颈使搜索局限于修补失败。我们的关键认识是,排名比绝对结果回归更平滑:判断哪个技能更好,比预测精确分数需要更少真值评估。据此提出SkillLift,学习与真值对齐的准则作为结构化评价空间,将技能搜索与真值成本解耦。我们将其形式化为交替求解的双层优化:内循环用冻结准则作为廉价替代,无真值调用成本地指导修改;外循环调用少量完整运行,通过排名相关性重新对齐准则,摊销成本并稳定文本空间更新。复杂智能体任务实验显示,方法优于现有自动技能方法,较前沿演化方法少40—70%token成本。代码见原摘要链接。