论文

上下文、推理与层级:对抗性POMDP中复合LLM智能体设计的成本-性能研究

Context, Reasoning, and Hierarchy: A Cost-Performance Study of Compound LLM Agent Design in an Adversarial POMDP

智能体系统上下文与知识上下文工程Agent任务评测

摘要

在对抗性、部分可观测的序贯环境中部署复合LLM智能体,需要权衡若干设计维度:(1) 智能体看到什么,(2) 它如何推理,(3) 任务如何在组件之间分解。然而从业者缺乏指引:哪些设计选择真正提升性能,哪些只是推高推理成本。我们在CybORG CAGE-2(一个建模为部分可观测马尔可夫决策过程(POMDP)的网络防御环境)中对复合LLM智能体设计进行受控研究。奖励非正,因此所有配置都运行在失败缓解模式。我们的评估覆盖五个模型家族、六个模型与十二种配置(3,475个回合),并进行token级成本核算。我们变化上下文表示(原始观测 vs. 带压缩历史的确定性状态跟踪层)、深思机制(自提问、自我批评与自我改进工具,可选思维链提示)与层级分解(单体ReAct vs. 委派给专门子智能体)。我们发现:(1) 程序化状态抽象带来最高的每token回报(RPTS),比原始观测最多提升76%的平均回报。(2) 将深思工具分布到层级之中,相对仅用层级会降低所有五个模型家族的性能,平均回报最多差3.4倍,同时多消耗1.8-2.7倍的token。我们将这种破坏性模式称为深思级联(deliberation cascade)。(3) 不含深思的层级分解对大多数模型取得最佳绝对性能,且上下文工程总体上比深思更具成本效益。这些发现为结构化对抗POMDP给出一条设计原则:投资于程序化基础设施与干净的任务分解,而非更深层的单智能体推理,因为这些策略在组合时可能相互干扰。

上下文、推理与层级:对抗性POMDP中复合LLM智能体设计的成本-性能研究:论文配图
图 1. 端到端系统架构。确定性层(左)根据 CybORG 观察结果编译结构化上下文并组装代理提示。 Planner(右)执行 ReAct 循环,在将经过验证的操作发送回环境之前,可以选择委托给 Analyst 和 ActionChooser 子代理。系统图显示左侧的确定性基础设施(ReAct 模板、知识、提示构建、网络状态和历史记录),输入到右侧的 Planner,其中包含审议工具和可选的子代理(ActionChooser、Analyst)。 Planner 向 CAGE-2 环境发出一个操作,该环境返回下一个观察结果。