论文
通过经验记忆改善LLM Agent的序贯决策
Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory
摘要
大语言模型在单步推理任务上取得了显著的改进,但在序列决策中的表现相对不足。我们在此研究完全可观察的两玩家零和博弈,提供真实评估:结果由规则决定,并且可以计算或近似个体行动的最优性,无需依赖于判别模型。在不同模型层级中,LLMs在简单的游戏中表现出劣化,在如跳棋或跳棋等游戏中输给MCTS对手。保留游戏树结构但重写表面形式的遮蔽方法并未显著改变性能,表明差距并非仅由已记住策略的记忆能力解释。受此性能差距的启发,我们引入了一个增强型的主动框架,设计用于解决序列决策问题,并且处理了如信用分配等常见的挑战。我们在跳棋上展示了在游戏结束后反思和规则提取后,模型权重不变的情况下,性能有显著改善。
