论文

自我进化的技能是否可以推广到遗留任务?

Do Self-Evolving Skills Generalize to Held-Out Tasks?

智能体系统Agent Skills智能体自我改进

摘要

人工智能Agent可以将从过去的任务中学到的知识具体化为可重用的技能,例如过程、清单、代码或其他可执行工件,在解决新任务时可以检索和重用它们。自进化技能方法在每轮训练任务的练习后不断重写这些技能,然后将该技能用于同类的新任务。我们问一个问题:技能在训练任务中表现出的改进是否会延续到新的测试任务中?我们在六个基准上测试了五种自我进化方法和一次性技能,每种方法都使用相同的模型、相同的Agent和相同的训练/测试分割。在训练任务中改进的 21 项技能中,有 5 项在测试任务中保留了所有改进,13 项保留了部分改进,3 项则没有保留。没有一种现有的方法在任何地方都是最好的。当我们阅读这些技能时,那些继承得很差的技能通常会修复应该取决于任务的细节,例如列名称和输出文件,或者将对一个失败的修复变成每个任务的规则。阅读技能内容的大语言模型评审通常可以看到这一点:它对完成的技能进行排名,就像 86% 的配对中的测试结果一样。但它对单个编辑的效果预测不佳,因此仍然必须通过运行来测试编辑。基于这些发现,我们描述了通用技能优化(GSO),它只保留写作技能的指南,并为每个任务编写一个新技能;它在所有六个基准测试中得分最高。