论文
Learn2Play:陌生游戏环境中的 Agent 经验学习
Learn2Play Bench: How Well Do LLM Agents Learn from Experience in Unfamiliar Environments?
摘要
学习经验对于 LLM 智能体适应陌生和动态的环境至关重要。因此,评估这种能力对于了解智能体如何有效地获取和使用新知识非常重要。现有的基准试图评估这种能力,但它们主要评估指令中提供的规则或预训练模型已经熟悉的规则的任务,这使得很难区分通过交互学习与利用既有知识推理。为了解决这个问题,我们引入了Learn2Play Bench,这是新设计的基于文本的游戏的基准,其规则新颖或违反直觉,要求智能体通过交互来获取知识,而不是仅仅依赖于预先训练的知识。这些游戏提供可重复的反馈和自动评分,从而能够对重复尝试的学习进行受控评估。我们还改变游戏实例来测试智能体是否可以将他们所学到的知识应用到新情况中。因此,我们评估了骨干模型、自我进化方法和智能体 Harness如何影响智能体的学习能力,揭示了三个发现:(1)经验保留:保留行动和反馈的完整记录比将这些经验总结为规则或策略更能支持更有效的学习。 (2)人类智能体差距:表现最好的人类玩家比评估的智能体获得更高的峰值分数。人类探索更多不同的策略,并减少重复行动。 (3) Harness 很重要:在 骨干模型 固定的情况下,更改 Harness 可以提高性能,同时降低估计的推理成本。总之,这些发现为 LLM 智能体如何从经验中学习提供了见解,并为未来提高学习能力的工作提出了方向。项目网址:https://liushiliushi.github.io/learn2play-bench-website/
