论文
奖励驱动的LLM智能体工作流:POMDP路由与自校正的合成
Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making
摘要
本文针对当前大语言模型(LLM)智能体应用的关键技术挑战——长程规划、稀疏奖励归因与动态环境交互——设计并优化一个智能体工作流。所提架构基于核心AI范式的合成:视觉、语言、生成、图、多模态、强化与智能体智能。不同于依赖静态提示、缺乏稳健感知—行动回路的常规基线模型,我们的方法引入部分可观测马尔可夫决策过程(POMDP)路由机制,并以内部的自校正奖励模型增强——在执行前评估决策轨迹。通过集成多模态输入与先进强化学习原则(如近端策略优化与价值函数逼近),智能体维持长期结构记忆、动态调整推理路径以缓解误差累积。在ALFWorld具身模拟环境与WebShop在线导航基准上的实证实验显示,相对标准ReAct框架等主流基线,任务成功率与轨迹效率绝对提升24.5%。全面消融研究确认奖励驱动的批评模块对抑制幻觉率的显著贡献。该研究把强化学习与基于图的记忆的理论基础同自主智能体工作流连接起来,最终架构为复杂多步自主系统的AI技术开发提供实用、可扩展的参考框架。代码见https://github.com/01Amez/RLAW_Implementation。