论文
备忘录 3:通过反思规则手册进行基于模型的递归自我改进
Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks
摘要
学习在陌生的环境中采取行动需要智能体推断世界是如何运作的,并在新证据出现时修改这种理解。然而,有限的观察可以支持多种世界模型,这些模型解释了过去的相互作用,但预测了未见状态的不同结果。我们推出了 Memento 3,它以 Memento 系列为基础,使冻结的 LLM 智能体能够通过外部记忆不断学习明确的世界模型。该代理维护自然语言规则手册作为持久语义记忆,记录有关环境动态的可修改假设,同时留下未指定的未知方面。它将这个规则手册编译成可执行代码以进行预测和规划。通过观察、反思、规则修订、编译和验证的连续循环,代理使用预测错误来完善规则手册及其代码。仅当LLM认为更新的代码忠实于规则手册并且单元精确重放再现了观察到的转换时,更新的代码才会被接受。我们将此过程作为基于模型的递归自我改进 (RSI) 途径进行研究: 代理自主探索环境,修改其世界模型,并使用经过验证的更新来指导后续的交互和学习,而底层的LLM保持不变。人口扩展并行维护多个世界模型,共享交互证据并使用它们的预测来指导探索。在 ARC-AGI-3 上,单模型代理清除了所有 25 个公共游戏的每个级别,实现了 100.0 的平均相对人类行动效率(RHAE),并使用了 44% 的人类行动计数。在 Atari Pong 案例研究中,学习反馈控制器在具有不同开局的三个评估回合中均以 21:0 获胜,无需进一步的 LLM 调用。