论文

MetaSkill-Evolve:经双时间尺度元技能进化的LLM智能体递归自改进

MetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution

智能体系统Agent Skills智能体自我改进递归自我改进(RSI)

摘要

近期LLM智能体 tackle 日益长程开放的任务,外部技能(供给智能体的可复用流程知识)进一步扩展该能力。但固定的手写技能很少最优、也无法适应任务多样性。自改进智能体经从执行轨迹重写技能文件应对,收益可观——但这种自进化仍非递归:它只改进任务技能(智能体做什么),而改进流程(如何改进)只写一次、保持固定。我们引入MetaSkill-Evolve:使智能体技能改进递归化的双时间尺度框架——每个分支同时携带任务技能s与分支局部元技能m=(ψ,σ,α,π,ε),五个组件参数化改进管线的分析器、检索器、分配器、提议者与进化者。任务技能在快循环进化,元技能在慢循环经把同一管线应用于自身而进化——无额外模型或目标。五个管线智能体共享单一冻结骨干:MetaSkill-Evolve在三个智能体基准(OfficeQA、SealQA、ALFWorld)上超过无技能、静态技能与单层进化基线——留出测试准确率较原始骨干分别提升+23.54、+16.09与+1.92分。

MetaSkill-Evolve:经双时间尺度元技能进化的LLM智能体递归自改进:论文配图
图 1:座席技能改进的四种机制。无技能:没有可重复使用的技能记忆。静态技能:手工编写的 s0s_{0} 保持固定(挂锁)。单级进化:任务技能进化为 s0→s1→s2s_{0}\!\to\!s_{1}\!\to\!s_{2},但驱动元流程保持挂锁状态。 MetaSkill-Evolve(我们的):分支级元技能 m=(ψ,σ,α,π,ε)m=(\psi,\sigma,\alpha,\pi,\varepsilon) 通过重写 ss 的相同五代理管道在较慢的外环上共同进化,无需额外的模型和额外的框架。