论文
MEMO:面向稳健多轮多智能体LLM游戏的记忆增强模型上下文优化
MEMO: Memory-Augmented Model Context Optimization for Robust Multi-Turn Multi-Agent LLM Games
摘要
多回合、多代理 LLM 游戏评估通常会表现出巨大的运行差异。在长视野交互中,小的早期偏差会在回合中复合,并通过多智能体耦合而放大。这会影响胜率估计,并使重复锦标赛中的排名变得不可靠。及时选择会产生不同的有效政策,从而进一步恶化这种情况。我们通过 MEMO(内存增强模型上下文优化)解决了不稳定和性能不佳的问题,这是一种自我对弈框架,通过耦合保留和探索来优化推理时间上下文。保留维护一个持久的记忆库,存储来自自我游戏轨迹的结构化见解,并在以后的游戏中将它们作为先验注入。探索通过 TrueSkill 运行锦标赛式的快速进化和不确定性感知选择,并使用优先重播来重新访问罕见和决定性的状态。在五种基于文本的游戏中,MEMO 将 GPT-4o-mini 的平均胜率从 25.1% 提高到 49.5%,将 Qwen-2.5-7B-Instruct 的平均胜率从 20.9% 提高到 44.3%,每个任务使用 2,000 美元的自玩游戏。运行间方差也会下降,从而在提示变化中提供更稳定的排名。这些结果表明,多智能体 LLM 游戏的性能和鲁棒性通过上下文优化有很大的改进空间。 MEMO 在谈判和不完美信息博弈中取得了最大的收益,而 RL 在完美信息环境中仍然更有效。
