论文

JADE:弥合动态Agentic RAG中战略与执行层的鸿沟

JADE: Bridging the Strategic-Operational Gap in Dynamic Agentic RAG

模型训练强化学习

摘要

检索增强生成(RAG)的演进已从静态检索流水线转向动态的agentic工作流,由中央规划器统筹多轮推理。然而,现有范式面临关键的两难:要么在僵化、固定图架构内联合优化各模块,要么在赋能动态规划的同时把执行器当作冻结的黑箱工具。我们发现,这种解耦优化造成战略-操作失配:精巧的规划策略因未适配的局部执行器而无法落地,尽管系统复杂度增加,却常带来负向性能收益。本文提出JADE(Joint Agentic Dynamic Execution),一个在动态多轮工作流内联合优化规划与执行的统一框架。通过把系统建模为统一在单一共享主干之下的合作多智能体团队,JADE支持由结果奖励驱动的端到端学习。这一方式促成协同适应:规划器学会在执行器的能力边界内运作,而执行器演化以对齐高层战略意图。实证结果表明,JADE把原本割裂的模块转化为协同系统,通过联合优化带来显著性能提升,并经由动态工作流编排实现效率与效果之间的灵活平衡。

JADE:弥合动态Agentic RAG中战略与执行层的鸿沟
图2:JADE 的总体框架。系统在规划与执行的迭代循环中运行。(1) 推理阶段(左):过程是递归的——对于全局状态 s_t 中当前未解决的节点(即某个特定子查询,见 Eq. 2),调用 Planner 编排专门的工作流。该工作流由专门的 Executor(例如 Query Decomposition、Retrieval Agent)执行,以更新 s_t 进入下一轮。(2) 训练阶段(右):为实现联合优化,多轮轨迹中涉及的每个智能体生成转移三元组 ⟨o_{t,k}, a_{t,k}, r_{t,k}⟩。这些转移被汇总到统一的 Experience Buffer 中,随后用于更新参数共享的策略模型,使战略规划与操作执行对齐。