论文

RSIAgent:在新环境中自主探索并构建递归自改进记忆

RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments

上下文与知识记忆Agent记忆

摘要

数字智能体常需适应接口、工具与失效模式未被预训练完整覆盖的新环境。我们提出无需训练的多智能体框架RSIAgent,通过自主记忆构建实现递归自改进。它协调课程、执行和验证智能体,持续探索环境、核验结果并保留环境专属知识,包括动作、条件与后果之间可复用的因果关系。它采用先广后深策略,以并行广泛递归自探索发现多样环境结构,再集中深入探索困难案例、隐藏约束、边界条件与未知因果依赖。所得记忆被冻结,可直接复用于下游任务,不更新模型参数。在OSWorld-v2和Agent’s Last Exam上的实验显示,RSIAgent显著改善强开源模型,使Kimi-K3与GLM-5.3超过包括GPT-6在内的前沿闭源模型。

RSIAgent:在新环境中自主探索并构建递归自改进记忆:论文配图
图1:RSIAgent总览。(a)无需标准标签或人工监督,经递归课程—行动—验证循环自主探索并适应新环境。(b)在论文所用OSWorld 2.0离线版本及Agents’ Last Exam近期任务上,Kimi-K3、GLM-5.3等开源模型借此超过所比较的GPT-6 Astra等闭源模型。