论文

StraTune:自适应选择修订运算符以实现自我发展的 LLM 技能

StraTune: Adaptive Selection of Revision Operators for Self-Evolving LLM Skills

智能体系统Agent Skills

摘要

大语言模型(LLM)可以从执行反馈中学习可重用的文本技能,而无需更新其参数,但有效地决定如何修改这些技能仍然是一个关键挑战。现有方法通常依赖于固定的修订运算符、搜索策略以及在其下应用的修订形式。然而,我们观察到,没有一个修订运算符能够在各个任务中始终表现最佳,并且重复应用不合适的运算符可能会限制进一步的改进。我们提出了 StraTune(策略引导技能调整),它让冻结的优化器 LLM 在每一轮从优化状态中选择修订运算符,优化状态被定义为当前执行反馈以及早期策略和表单的记录结果。每个修正操作员的候选技能都会通过一个候选评估,该评估会在小样本集上筛选增益和回归,并在较大样本集上对其进行验证,并且每个结果都会写回优化状态以供以后选择。在四个基准和两个LLM设置中,StraTune 在大多数设置中都优于所有五个基准。消融将收益归因于修正算子的自适应选择,因为固定、随机、计划和强盗策略选择的得分都较低,而通过小目标 LLM 学习的技能也可以提高更强的技能。代码和学习的技能可在 https://github.com/seai-lab/StraTune. 获取