论文

Meta^n:通过涌现深度实现递归自我改进

Meta$^n$: Recursive Self-Improvement through Emergent Depth

智能体系统Agent Harness智能体自我改进递归自我改进(RSI)

摘要

自我改进的LLM智能体改进的是答案,而不是产生答案的过程。增加元层次的系统把该层次固定不变,而编辑自身的系统必须让自己编辑机制的一部分保持不动以维持稳定,这将它们实现的元深度限制在大约两层。我们提出Meta^n,它保持元操作固定,转而对其输入进行递归。该操作Ω被反复应用于其自身产物,读取其下层求解器栈的轨迹以及产生它们的代码,然后把下一层写成为一个战略性预处理过程和一个可调用的辅助函数库。因为Ω从不改变,它不会使系统失稳;因为其输入严格增长,每一层都比上一层从更高的视角推理。深度由收敛决定而非预先固定,进化档案在层链上进行搜索。在两个骨干模型上,Meta^n在全部八个基准家族上优于先前的自我改进智能体。最突出的例子是ARC-AGI-2——一个为抵抗技能记忆而构建的基准——只有它得分高于零。消融实验表明,递归带来的大部分增益来自每层传递给下一层的条件信息,并且尽管没有提示加以规定,不同的层角色随深度涌现。代码可在 https://github.com/minnesotanlp/meta-n 获取。

Meta^n:通过涌现深度实现递归自我改进:论文配图
图1:Metan一览。(左) 单一的通用元操作 Ω 被递归应用,每个元层包裹其下的栈(基础求解器→层1→元层2,3,…,n)。角色随深度涌现,无需手工设计。(右) LawBench罪名预测上的搜索进度,两个Metan变体都比Gödel Agent(Yin et al., 2024)和OpenEvolve(Sharma, 2025)爬升更快、收敛更高。