论文

学习配置Agentic AI系统

Learning to Configure Agentic AI Systems

智能体系统模型训练强化学习Agent HarnessAgentic RL

摘要

配置基于 LLM 的代理系统涉及从大型组合设计空间中选择工作流程、工具、token预算和提示,目前通常通过固定的大型模板或手动调整的启发式方法来处理。这会导致脆弱的行为和不必要的计算,因为相同的繁琐配置通常应用于简单输入查询和硬输入查询。我们将代理配置制定为明智的查询决策问题,并引入 ARC(代理资源和配置学习器),它使用强化学习来学习轻量级分层策略,以动态定制这些配置。在涵盖推理和工具增强问答的多个基准中,学习策略始终优于强大的手工设计基准和其他基准,实现了高达 25% 的任务准确性提高,同时还降低了token和运行时成本。这些结果表明,学习每个查询代理配置是“一刀切”设计的强大替代方案。

学习配置Agentic AI系统
图2:训练流水线。结构策略(structure policy)选择工作流、工具和预算,而提示策略(prompt policy)组织指令。在 RL 训练期间,回合(episode)被存储在记忆缓冲区中。RL 收敛后,过滤出高奖励回合并将其用于监督微调(SFT),从而巩固成功策略并提升一致性。