论文
以状态为中心的决策过程
State-Centric Decision Process
摘要
网页浏览器、代码终端和交互式模拟等语言环境输出的是原始文本而非状态,且不提供MDP分析所需的任何运行时结构:没有显式状态空间,没有从观测到状态的映射,没有经过认证的转移,也没有终止判据。我们提出以状态为中心的决策过程(State-Centric Decision Process,SDP),这是一个运行时框架,通过让智能体在行动时逐个谓词地构建这些缺失的输入。在每一步,智能体提交一个描述世界应然样貌的自然语言谓词,采取行动使其成真,并将观测与其核对。通过核验的谓词成为经过认证的状态,由此产生的轨迹携带了语言环境不提供的四个对象,即任务诱发的状态空间、观测到状态的映射、经认证的转移和终止判据。我们在涵盖规划、科学探索、网络推理和多跳问答的五个基准上评估SDP。SDP在全部五个基准上取得最佳的免训练结果,且随着时间跨度(horizon)增长优势不断扩大。经认证的轨迹还支持反应式智能体无法进行的分析,包括逐谓词的贡献归因、失败定位、部分进展度量以及模块化算子替换。
