论文

以状态为中心的决策过程

State-Centric Decision Process

智能体系统Agent 架构与控制循环Agent Harness

摘要

网页浏览器、代码终端和交互式模拟等语言环境输出的是原始文本而非状态,且不提供MDP分析所需的任何运行时结构:没有显式状态空间,没有从观测到状态的映射,没有经过认证的转移,也没有终止判据。我们提出以状态为中心的决策过程(State-Centric Decision Process,SDP),这是一个运行时框架,通过让智能体在行动时逐个谓词地构建这些缺失的输入。在每一步,智能体提交一个描述世界应然样貌的自然语言谓词,采取行动使其成真,并将观测与其核对。通过核验的谓词成为经过认证的状态,由此产生的轨迹携带了语言环境不提供的四个对象,即任务诱发的状态空间、观测到状态的映射、经认证的转移和终止判据。我们在涵盖规划、科学探索、网络推理和多跳问答的五个基准上评估SDP。SDP在全部五个基准上取得最佳的免训练结果,且随着时间跨度(horizon)增长优势不断扩大。经认证的轨迹还支持反应式智能体无法进行的分析,包括逐谓词的贡献归因、失败定位、部分进展度量以及模块化算子替换。

以状态为中心的决策过程:论文配图
图 1:SDP 执行结构。 Propose构建从s0s_{0}到gg的谓词链。实现下一个谓词的行为。 Validate 检查观察结果,是 𝒪\mathcal{O} 的唯一接口。当目标失败超过 bb 时,Replan 会丢弃并构建新状态。