论文
APEx:蒸馏智能体过程经验,实现自适应深度研究问答
APEx: Distillation of Agent Procedural Experience for Adaptive Deep Research Question Answering
摘要
深度研究代理使用外部工具增强大语言模型,通过多轮推理回答复杂的长期问题。从先前的经验中学习对于持续改进至关重要,但现有方法要么检索给决策带来负担的详细任务特定痕迹,要么提炼与下游政策适应脱钩的程序技能。我们提出了 APEx,一种分层体验利用框架,它将交互历史组织成实例级轨迹记忆和类别级程序技能,并通过 Executor、Distiller 和 Planner 的闭环架构将它们耦合起来。这三个模块通过三阶段交替 GRPO 训练范例进行优化,实现奖励引导的技能蒸馏,而不是固定提示生成。在测试时,通过技能引导的测试时强化学习,提炼出的技能可以作为在线 Planner 适应的程序先验,从而允许通过技能调整正则化进行无基础的自我改进,以防止策略漂移。 7 个基准测试的实验表明,APEx 实现了最先进的性能,超越 GPT-5.4 14.7 分,超越最强内存增强基线 3.0 分。
