FORGE:通过种群广播实现无权重更新的自进化智能体记忆
FORGE: Self-Evolving Agent Memory With No Weight Updates via Population Broadcast
摘要
LLM智能体能否在不进行梯度更新的情况下,通过自生成记忆改进决策?我们提出FORGE(Failure-Optimized Reflective Graduation and Evolution),一个分阶段的、基于种群的协议,为层级化ReAct智能体进化以提示注入方式使用的自然语言记忆。FORGE封装了一个Reflexion式内循环:专门的反思智能体(使用同一底层LLM,不从更强模型蒸馏)将失败轨迹转化为可复用的知识工件——文本启发式(Rules)、少样本示范(Examples)或两者兼有(Mixed);外循环则在阶段之间把表现最佳实例的记忆传播给种群,并通过毕业准则冻结已收敛的实例。我们在CybORG CAGE-2上评估——这是一个30步时域、对抗B-line攻击者的随机网络防御POMDP——四个受测LLM家族(Gemini-2.5-Flash-Lite、Grok-4-Fast、Llama-4-Maverick、Qwen3-235B)的零样本奖励都呈强负值且重尾分布。与零样本基线和Reflexion基线(孤立的单流学习)相比,FORGE在全部12个模型-表示条件下,将平均评估回报较零样本提升1.7-7.7倍、较Reflexion提升29-72%,并将重大失败率(低于-100)降低到低至约1%。我们发现:(1) 种群广播是关键机制,无毕业消融证实性能增益由广播承载,而毕业主要节省计算;(2) Examples在四个模型中的三个上取得最高回报,Rules则以约少40%的token提供最佳成本-可靠性组合;(3) 较弱的基线模型获益不成比例地大,表明FORGE可能缩小能力差距而非放大强模型优势。所有证据均限于CAGE-2 B-line场景;跨家族发现仅为方向性证据。
