论文
快与慢的思考:LLM Agent 的步级认知深度自适应
Think Fast and Slow: Step-Level Cognitive Depth Adaptation for LLM Agents
摘要
大语言模型(LLM)正日益被部署为执行多轮决策任务的自主智能体。然而,当前智能体通常依赖固定的认知模式:非思考型模型直接给出即时回应,而思考型模型一律进行深度推理。这种僵化对长程任务而言效率低下,因为长程任务各步骤的认知需求差异显著,有些需要策略性规划,有些只需例行执行。本文提出 CogRouter,一个训练智能体在每一步动态调整认知深度的框架。基于 ACT-R 理论,我们设计了从本能反应到策略性规划的四个分层认知等级。我们的两阶段训练包括用于灌输稳定等级特定模式的认知感知监督微调(Cognition-aware Supervised Fine-tuning,CoSFT),以及通过置信度感知的优势重加权实现步级贡献归因的认知感知策略优化(Cognition-aware Policy Optimization,CoPO)。关键洞见在于:合适的认知深度应使所产生的动作的置信度最大化。在 ALFWorld 与 ScienceWorld 上的实验表明,CogRouter 以更优的效率取得最先进的性能。使用 Qwen2.5-7B 时,其成功率达 82.3%,超过 GPT-4o(+40.3%)、OpenAI-o3(+18.3%)和 GRPO(+14.0%),同时少用 62% 的 token。
