论文
上下文收集决策过程:智能体搜索的POMDP框架
The Context Gathering Decision Process: A POMDP Framework for Agentic Search
摘要
大语言模型 (LLM) 代理部署在复杂的环境中,例如大规模代码库、企业数据库和对话历史记录,其中相关状态远远超出其上下文窗口。为了导航这些空间,代理必须迭代地探索环境以查找相关信息。然而,如果没有明确的基础设施,代理的工作记忆可能会退化为搜索状态的有损表示,从而导致冗余工作(例如重复循环)和过早停止。在这项工作中,我们将这一挑战形式化为上下文收集决策过程(CGDP),这是一种专门的部分可观察马尔可夫决策过程,其中代理的目标是自适应地完善其信念状态以隔离任务的必要信息。我们将 LLM 的行为建模为 CGDP 中的近似汤普森采样,并引入基于谓词的方法,将 LLM 的隐式搜索分解为显式和模块化操作。然后,我们为迭代 LLM 代理推导出两种即插即用的干预措施:一种持久的、基于谓词的信念状态,它在保留多跳推理的同时限制上下文;以及一个程序化的穷举门,它可以停止无效的搜索而不会过早停止。通过四种方法和三个问答领域,我们凭经验验证,用 CGDP 驱动的信念状态替换 LLM 的隐式状态可以将多跳推理提高高达 11.4\%$;而模块化编程耗尽检测可节省高达 $39\%$ 的词元,而不会降低代理性能。最终,我们认为将 LLM 代理循环构建为 CGDP 可以指导代理搜索工具的模块化、无干扰改进的设计。