论文

面向自主LLM Agent结构化漂移诊断与恢复的图强化学习框架

A Graph-Based Reinforcement Learning Framework for Structured Drift Diagnosis and Recovery in Autonomous LLM Agents

模型训练强化学习Agentic RL

摘要

自主LLM Agent越来越多地被部署到复杂的真实工作流中,但它们仍然容易受到运行时行为漂移的影响——一种对原始任务的静默偏离,可能对外部系统造成不可逆的副作用。现有方法在提示层面处理漂移,但缺乏步骤级检测、风险评估和恢复决策的结构化机制。由于执行主任务的主Agent通常是大而昂贵的模型,无法在每次部署时重新训练,本工作转而针对一个即插即用的恢复模块。它引入一个基于图的框架:通过强化学习训练单个小语言模型,使其专精于位于主Agent外部的恢复图的每个节点。每个节点有精确的角色:漂移分类、操作检测、风险评估或最终决策,模型学习生成适配该角色的结构化XML格式推理。训练将基于规则的结构奖励与LLM-as-judge语义质量信号相结合,使模型既按如何回答(模式与长度)也按说了什么被评分。在公开的AppWorld基准上的实验表明,该方法通常能利用疑似漂移起点的信息,用一个小语言模型发出正确的恢复决策。此外,训练后的小语言模型可靠地遵循规定的输出模式,并按其被指派的节点角色在各字段生成语义恰当的内容。

面向自主LLM Agent结构化漂移诊断与恢复的图强化学习框架:论文配图
图1:已部署 LLM 智能体场景中漂移恢复框架的必备准则。