论文

自动化具身Agent架构的设计

Automating the Design of Embodied Agent Architectures

智能体系统Agent 架构与控制循环

摘要

体现代理通常被构建为手工设计的感知、记忆、规划和行动模块的组合。这种模块化暴露了巨大的架构设计空间,但当前的系统仍然依赖研究人员的直觉来选择信息存储位置、观察结果如何处理以及模型调用如何连接。代理架构搜索(AAS)自动化了文本域代理的此类设计,但尚未通过模拟器执行轨迹对感知具身Agent进行系统评估。我们研究这种转移。我们引入了 AgentCanvas,一个类型化图运行时,它将具体执行器托管为可编辑的节点和连线程序,具有模拟器感知的执行和情节级日志,以及 KDLoop,一个编码代理搜索过程,循环通过提案、批评、实验和 蒸馏,并在停顿后触发反射。我们评估了四个具体执行器的三个 AAS 变体,涵盖视觉语言导航、具体问答和语言条件操作。由此产生的 3x4 矩阵表明,架构级搜索可以在具身任务上产生可部署的、定向的成功率增益,而一个明显的高分候选者会因为存在泄漏而被拒绝。与此同时,这些实验暴露了文本域 AAS 中静音的约束:优化信号可能会被执行轨迹噪声掩盖,搜索可能陷入本地编辑盆地,即使有详细日志可用,情节级贡献分配也只能部分出现。这些结果描述了针对具身Agent的自动化架构搜索的前景和当前限制。