论文

FORGE:通过种群广播实现无权重更新的自进化智能体记忆

FORGE: Self-Evolving Agent Memory With No Weight Updates via Population Broadcast

上下文与知识记忆Agent记忆

摘要

LLM智能体能否在不进行梯度更新的情况下,通过自生成记忆改进决策?我们提出FORGE(Failure-Optimized Reflective Graduation and Evolution),一个分阶段的、基于种群的协议,为层级化ReAct智能体进化以提示注入方式使用的自然语言记忆。FORGE封装了一个Reflexion式内循环:专门的反思智能体(使用同一底层LLM,不从更强模型蒸馏)将失败轨迹转化为可复用的知识工件——文本启发式(Rules)、少样本示范(Examples)或两者兼有(Mixed);外循环则在阶段之间把表现最佳实例的记忆传播给种群,并通过毕业准则冻结已收敛的实例。我们在CybORG CAGE-2上评估——这是一个30步时域、对抗B-line攻击者的随机网络防御POMDP——四个受测LLM家族(Gemini-2.5-Flash-Lite、Grok-4-Fast、Llama-4-Maverick、Qwen3-235B)的零样本奖励都呈强负值且重尾分布。与零样本基线和Reflexion基线(孤立的单流学习)相比,FORGE在全部12个模型-表示条件下,将平均评估回报较零样本提升1.7-7.7倍、较Reflexion提升29-72%,并将重大失败率(低于-100)降低到低至约1%。我们发现:(1) 种群广播是关键机制,无毕业消融证实性能增益由广播承载,而毕业主要节省计算;(2) Examples在四个模型中的三个上取得最高回报,Rules则以约少40%的token提供最佳成本-可靠性组合;(3) 较弱的基线模型获益不成比例地大,表明FORGE可能缩小能力差距而非放大强模型优势。所有证据均限于CAGE-2 B-line场景;跨家族发现仅为方向性证据。

FORGE:通过种群广播实现无权重更新的自进化智能体记忆:论文配图
图 1. 系统概览。 (左)具有动态内存注入的分层 ReAct 代理。 (右)反射学习循环:当奖励低于阈值时,专用的 Reflector 或 Exemplifier 代理会分析完整的轨迹并合成知识工件,然后将其注入到代理的内存中。该图显示了层次化的 ReAct 代理架构,左侧有 Planner、Analyst 和 ActionChooser 子代理,右侧的反射和示例学习代理将失败的轨迹转换为内存更新。