论文

Hyperagents

智能体系统上下文与知识记忆Agent 架构与控制循环智能体自我改进Agent记忆递归自我改进(RSI)

摘要

自我改进的AI系统旨在通过学习改进自身的学习与问题求解过程,来减少对人工工程介入的依赖。现有的自我改进方法依赖固定的、人工设计的元层机制,从根本上限制了此类系统的改进速度。Darwin Gödel Machine(DGM)通过反复生成并评估自我修改的变体,展示了编码领域中的开放式自我改进。由于评估与自我修改本身都是编码任务,编码能力的提升可以转化为自我改进能力的提升。然而,这种对齐关系在编码领域之外并不普遍成立。我们提出hyperagents,一种自指式智能体,它将任务智能体(求解目标任务)与元智能体(修改自身和任务智能体)整合进单个可编辑程序。关键在于,元层修改过程本身也是可编辑的,从而实现元认知式自我修改,不仅改进任务求解行为,也改进生成未来改进的机制。我们通过扩展DGM实例化该框架,创建了DGM-Hyperagents(DGM-H),消除了任务表现与自我修改技能之间领域特定对齐的假设,从而有潜力在任意可计算任务上支持自我加速的进展。在多个领域上,DGM-H随时间持续改进性能,优于没有自我改进或开放式探索的基线,也优于先前的自我改进系统。此外,DGM-H还改进了其生成新智能体的过程(例如持久记忆、性能追踪),这些元层改进可跨领域迁移并跨运行累积。DGM-Hyperagents让我们得以一窥开放式AI系统的样貌:它们不仅搜索更好的解决方案,还持续改进其“如何改进”的搜索方式。

Hyperagents:论文配图
图 1:带有超级代理的达尔文哥德尔机器。 DGM-Hyperagents (DGM-H) 将达尔文哥德尔机 (DGM) (Zhang et al., 2025b) 扩展到编码任务之外,使代理不仅能够提高其任务性能,而且能够在任何可计算任务中提高自身的能力。 (上)在 DGM 中,编码代理通过生成和评估存储在踏脚石档案中的自我修改变体,通过开放式探索不断发展。相同的编码代理既充当任务代理(要评估)又充当元代理(生成修改)。虽然这种设计可以实现编码方面的复合收益,但驱动自我改进的指令生成机制是固定的和手工制作的。因此,递归改进取决于编码性能和自修改能力之间的一致性。 (下)在 DGM-H 中,任务代理和元代理被组合成一个称为超级代理的可修改程序。这种设计使得元代理本身能够自主改进。该系统保留了DGM的开放式探索结构,同时使元级别改进机制可编辑。这使得元认知自我修改成为可能,并支持跨任何可计算任务的自我参照改进。