论文

ε-MemEvo:面向大语言模型程序进化的自适应跨任务记忆迁移

$\varepsilon$-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution

上下文与知识记忆Agent记忆

摘要

诸如FunSearch与AlphaEvolve等基于大语言模型的程序进化系统展现了发现新算法的强大能力,但通常孤立地优化每个任务,在完成后丢弃搜索经验。我们提出ε-MemEvo,一个面向大语言模型程序进化的跨任务知识迁移框架。ε-MemEvo将既往经验存储为任务无关的战术记忆:成功算法策略的紧凑自然语言摘要而非原始代码,从而可在具有不同API与评估器的任务间迁移。为避免语义不匹配记忆带来的负迁移,ε-MemEvo使用自适应注入门控来决定检索到的记忆是否注入以及以何种强度注入。我们在横跨数学优化与系统工程、共8个多样的优化基准上评估ε-MemEvo,采用内容级留一(Leave-One-Out)协议以排除目标任务的记忆条目。在主用的GPT-5主干上,ε-MemEvo在全部8个任务上均提升相对AdaEvolve的AUCC,平均相对增益+8.7%,并将早期收敛平均提升+9.4%。消融实验显示,朴素记忆注入可能灾难性失败,而自适应门控在全部五个消融任务上保持安全。数据更新后的后验在观测状态下可解释:在搜索正在改进时倾向于跳过(skip),并随早期与后期平台期从跳过转向提示(hint)。这些增益的计算开销不足1%。

ε-MemEvo:面向大语言模型程序进化的自适应跨任务记忆迁移:论文配图
图2:ε\varepsilon-MemEvo 架构。在 LOO 下,先前任务的最优程序被蒸馏为任务无关的战术(tactics)。在每次迭代中,状态条件化的 Thompson Sampling 门控选择跳过、提示或引导;检索到的战术与所选强度对基础提示进行增广。AdaEvolve 评估每个候选并返回延迟奖励以更新门控。在成功完成一次任务运行后,其最终最优程序为记忆贡献一个战术,供后续任务使用。