论文
AgentOdyssey:用于测试时持续学习代理的开放式长视野文本游戏生成
AgentOdyssey: Open-Ended Long-Horizon Text Game Generation for Test-Time Continual Learning Agents
摘要
为了让智能体在测试时从与世界的交互中不断学习,他们必须能够有效地探索,获取新的世界知识和技能,保留相关的情景经验,并进行长期规划。为了评估测试时持续学习代理的这些关键能力,我们引入了 AgentOdyssey,这是一种新颖的评估框架,可以按程序生成具有丰富实体、世界动态和长期任务的开放式文本游戏。至关重要的是,AgentOdyssey 超越了传统的机器学习假设,即学习不会在测试时发生,它将代理置于连续的、长期的环境中,在整个部署过程中将学习和推理交错在一起。我们进一步提出了一种多方面的评估方法,不仅可以衡量游戏进度,还可以提供关于世界知识获取、情景记忆、对象和动作探索、动作多样性和模型成本的诊断测试。我们评估生成的游戏中的不同代理范例。我们的实验结果揭示了智能体关键能力的关键限制,以及影响其有意义视野的因素。尽管性能随着更强大的基础模型而扩展,但即使是顶级智能体也仍然远远低于人类性能,这留下了巨大的改进空间。在代理机制中,我们发现短期记忆有利于多种代理范式,并且是代理测试时训练的重要组成部分。