论文
通过历史信息与对手感知在Agent群体中演化
Evolving in the Agent Jungle via History-Informed Opponent Awareness
摘要
通过互动学习适应策略是迈向更通用和自主的LLM代理的关键步骤。现有方法通常通过更新技能库来实现行为适应。然而,在多代理环境中,对手同时更新其策略,导致环境本身不断进化。因此,在这种设置中应用设计用于静态环境的技能更新方法,实际上是在更新一个过时的参考。为解决这一挑战,我们引入了OASE(Opponent-Aware Selective Evolution),它识别并采纳在动态多代理环境中真正有益的技能更新。具体来说,OASE在相同的条件下,通过锚定对手策略的历史快照,对候选技能和当前技能进行配对比较,并仅在估计的收益增加超过接受阈值时,采纳候选技能。我们在两个决策场景中进行了实验:第一价格拍卖和私人成本的科罗特竞争。实验结果表明,与反射式基准相比,OASE在两种环境中都实现了更低的最终均衡距离,同时接受显著较少的技能更新,从而抑制缺乏足够收益支持的策略变化。因此,OASE用证据锚定的选择取代盲目的更新,使代理能够在对手不断进化的情况下稳定且高效地适应策略。
