论文

Environment Maps:面向长程智能体的结构化环境表示

Environment Maps: Structured Environmental Representations for Long-Horizon Agents

上下文与知识记忆Agent记忆

摘要

尽管大语言模型(LLM)进展迅速,复杂软件工作流的鲁棒自动化仍是一个悬而未决的问题。在长程设置中,智能体经常受到级联错误与环境随机性的困扰;动态界面中的单步失误就可能导致任务失败,进而产生幻觉或反复试错。本文提出Environment Maps:一种持久化、与具体智能体无关的表示,它将屏幕录像与执行轨迹等异构证据整合进结构化图,从而缓解这些失败。该表示由四个核心组件构成:(1)Contexts(抽象化的位置)、(2)Actions(参数化的可供性)、(3)Workflows(观察到的轨迹)与(4)Tacit Knowledge(领域定义与可复用流程)。我们在WebArena基准的五个领域上评估该框架。配备环境图的智能体达到28.2%的成功率,几乎是将上下文限制在会话内的基线(14.2%)的两倍,并优于能够访问用于生成环境图的原始轨迹数据的智能体(23.3%)。通过在模型与环境之间提供结构化接口,Environment Maps为长程规划建立了持久化基础,且可被人解读、可编辑、可增量精炼。

Environment Maps:面向长程智能体的结构化环境表示:论文配图
图 1:环境图框架。该系统从多模态数据(例如痕迹和视频)中提取结构化的空间和语义知识来构建环境地图。该地图在任务执行期间充当代理的知识库,通知其动作-观察循环。黑色实线表示我们实验中使用的途径;灰线表示未使用的可选路径,例如人机交互编辑和代理跟踪的地图更新,禁用以维持受控的实验设置。