论文

VirtualEnv:一个具身AI研究平台

VirtualEnv: A Platform for Embodied AI Research

智能体系统Agent任务评测

摘要

随着大语言模型(LLM)在推理与决策上的持续进步,人们越来越需要逼真且可交互的环境来严格评估其能力。我们提出VirtualEnv,一个基于Unreal Engine 5构建的新一代仿真平台,可在具身与交互场景中对LLM进行细粒度基准评测。VirtualEnv支持丰富的代理-环境交互,包括物体操作、导航与自适应多代理协作,以及密室逃脱和程序化生成环境等游戏化机制。我们提供构建于Unreal Engine之上的用户友好API,让研究者能用自然语言指令部署并控制LLM驱动的代理。我们集成了GPT系列等大规模LLM与视觉-语言模型(VLM),从多模态输入生成新环境与结构化任务。我们的实验在复杂度递增的任务上对多个流行LLM进行基准评测,分析其在适应性、规划与多代理协调上的差异。我们还描述了程序化任务生成、任务验证与实时环境控制的方法论。VirtualEnv以开源平台发布,我们旨在推进AI与游戏交叉领域的研究,实现LLM在具身AI环境中的标准化评估,并为沉浸式仿真与互动娱乐的未来发展铺路。

VirtualEnv:一个具身AI研究平台
图1:VirtualEnv 中多智能体规划与执行的系统总览。VirtualEnv 是构建在 Unreal Engine 5 之上的高保真仿真环境,旨在在交互式、面向任务的场景中评估大语言模型(LLMs)。本图展示了多智能体任务执行的完整流程:用户提供自然语言指令,系统使用 vLLM(例如 GPT-4o)解释目标、生成符号化规划,并实时协调多个智能体。每个智能体接收环境信息——包括场景图(scene graph)和视觉上下文——并通过 VirtualEnv API 执行动作。性能通过目标完成检查和基于指令的成功指标进行评估。