论文

AgentGarten:不断发展的代理的代码世界

AgentGarten: Code Worlds for Evolving Agents

智能体系统模型优化Agent 环境交互智能体自我改进蒸馏

摘要

交互式虚拟世界允许代理通过探索和交互来学习。智能体可以学习的内容受到他们所练习的环境的限制,这些环境必须是忠实的,具有一致的状态、规则和动态,并且是现实的,具有遵循现实世界视觉分布的观察结果。在不同的世界中实现这两者仍然是一个瓶颈。我们引入了 AgentGarten,这是一个将模拟器和游戏引擎与共享神经渲染器结合起来以构建实时交互环境的框架。其模拟后端维护持久的世界状态并执行程序定义的交互规则,而渲染器则根据通过通用接口导出的结构化条件生成视觉观察结果。为了构建神经渲染器,我们将预训练的视频模型适应几何条件,使用我们提出的对抗性强迫对其进行提炼,并优化实时交互的推理。对抗性强迫使历史预填充可以通过精确重播进行区分,以便后续预测的损失更新渲染器对先前观察结果的编码方式,并且 添加真实数据对抗性监督以提高其视觉质量。在 AgentGarten 中,智能体通过视觉观察来感知世界,与其实时交互,并通过将每一轮的经验提炼成后续智能体继承和完善的剧本来进行改进。我们的实证研究表明,学习效率有了显着提高,智能体只需 4 轮学习,而传统强化学习对应的学习轮数为数百万轮。由于新的世界可以编写为代码并通过相同的界面呈现,因此环境可以与代理一起在数量和难度上进行扩展,这是朝着通过交互体验不断发展的代理迈出的一步。