论文
上下文、推理与层级:对抗性POMDP中复合LLM智能体设计的成本-性能研究
Context, Reasoning, and Hierarchy: A Cost-Performance Study of Compound LLM Agent Design in an Adversarial POMDP
摘要
在对抗性、部分可观测的序贯环境中部署复合LLM智能体,需要权衡若干设计维度:(1) 智能体看到什么,(2) 它如何推理,(3) 任务如何在组件之间分解。然而从业者缺乏指引:哪些设计选择真正提升性能,哪些只是推高推理成本。我们在CybORG CAGE-2(一个建模为部分可观测马尔可夫决策过程(POMDP)的网络防御环境)中对复合LLM智能体设计进行受控研究。奖励非正,因此所有配置都运行在失败缓解模式。我们的评估覆盖五个模型家族、六个模型与十二种配置(3,475个回合),并进行token级成本核算。我们变化上下文表示(原始观测 vs. 带压缩历史的确定性状态跟踪层)、深思机制(自提问、自我批评与自我改进工具,可选思维链提示)与层级分解(单体ReAct vs. 委派给专门子智能体)。我们发现:(1) 程序化状态抽象带来最高的每token回报(RPTS),比原始观测最多提升76%的平均回报。(2) 将深思工具分布到层级之中,相对仅用层级会降低所有五个模型家族的性能,平均回报最多差3.4倍,同时多消耗1.8-2.7倍的token。我们将这种破坏性模式称为深思级联(deliberation cascade)。(3) 不含深思的层级分解对大多数模型取得最佳绝对性能,且上下文工程总体上比深思更具成本效益。这些发现为结构化对抗POMDP给出一条设计原则:投资于程序化基础设施与干净的任务分解,而非更深层的单智能体推理,因为这些策略在组合时可能相互干扰。
