论文
以深度学习方式构建LLM智能体系统:从模块化设计到架构搜索
Building LLM Agent Systems the Deep Learning Way: From Modular Design to Architecture Search
摘要
大语言模型 (LLM) 彻底改变了人工智能研究,并实现了令人兴奋的智能体系统。为了构建复杂的LLM智能体系统,大多数现有研究依赖于其他领域的见解或启发式方法来手动构建智能体系统。然而,这种方法通常需要大量的手工设计,并且无法针对感兴趣的下游任务进行充分优化。受到深度学习巨大成功的启发,我们建议以模块化方式构建LLM智能体系统,类似于构建深度神经网络。我们的主要见解是在LLM构建块(例如检索、记忆和提示策略)与成功的深度学习模块(例如 MLP、注意力和循环模块)之间进行类比。我们进一步为LLM设计了前向推理和反馈机制,其中LLM中的提示被视为深度模型中的权重,反馈的提示优化类似于反向传播算法。我们还利用搜索算法来搜索LLM智能体系统的最佳配置,类似于深度学习研究中的神经架构搜索(NAS)。综合实验结果表明,针对LLM智能体系统提出的深度学习方案非常有效,特别是:(1)将LLM模块组织成深度学习式架构可产生显着的性能增益; (2)自动提示优化,相当于反向传播,能够有效地融合感兴趣任务的反馈,并实现至少 5% 的性能提升; (3) NAS等效算法可以很好地进一步优化LLM智能体系统架构,与随机设计的架构相比,性能提升11%。总的来说,我们的研究展示了将深度学习的成功转移到构建LLM智能体系统的令人兴奋的机会。
