论文

通过自调节模拟规划实现高效智能体推理

Efficient Agentic Reasoning Through Self-Regulated Simulative Planning

智能体系统Agent 规划

摘要

智能体应如何决定何时规划以及如何规划?主流做法把智能体构建为具有自适应计算(如思维链)的反应式策略并进行端到端训练,期待规划隐式涌现。由于无法控制规划的有无、结构或长度,这类系统大幅拉长推理,token利用低效且无法可靠提升准确率。我们主张,高效的智能体推理应把决策分解为三个系统:模拟推理(系统II)——通过世界模型把深思锚定在未来状态预测上;自调节(系统III)——通过学习到的配置器决定何时规划以及规划多深;反应执行(系统I)——处理细粒度动作。模拟推理无需逐领域工程即可在多样任务上提供统一规划,而自调节确保规划器只在需要时被调用。为验证这一点,我们开发了SR$^2$AM(Self-Regulated Simulative Reasoning Agentic LLM),在LLM的思维链内把两者实现为不同阶段,并以LLM本身充当世界模型。我们探索两种实例化:从提示式多模块系统中记录决策(v0.1),以及从预训练推理LLM的轨迹中重构结构化规划(v1.0),均先经监督学习、再经强化学习(RL)训练。在数学、科学、表格分析与网络信息检索任务上,v0.1-8B和v1.0-30B的Pass@1分别可与120-355B和685B-1T参数的系统相匹敌,而v1.0-30B的推理token消耗比同类智能体LLM少25.8-95.3%。RL使平均规划视野(planning horizon)增加22.8%,而规划频率仅增长2.0%,表明它学到的是“规划得更远”而非“规划得更频繁”。更广泛地说,习得的自调节确立了一条原则,我们期待它能从规划扩展到智能体如何治理自身的学习与适应。

通过自调节模拟规划实现高效智能体推理:论文配图
图 1:SR2AM 中自我调节模拟推理的图示。在每个步骤中,配置器(系统 III)决定是调用、继续还是跳过规划。当被调用时,模拟规划器(系统 II)会模拟建议的行动和预测的信念状态,以实现目标导向的规划。参与者(系统 I)处理细粒度推理和直接行动(未描绘)。配置器和规划器都是LLM思维链推理中的不同阶段。该示例描述了一个网络信息查找任务。