论文

利用轨迹图实现智能体LLM系统的执行前错误诊断

Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems

模型推理推理验证与自校正

摘要

基于大语言模型(LLM)的智能体已在广泛的复杂交互任务中展现出卓越性能。然而,它们常常难以应对具身AI等领域常见的长时程交互任务。这些场景中的复杂性与庞大的动作空间导致误差复合:单个次优动作就可能让整条轨迹脱轨,使智能体把有限的步数预算耗散在低效或不可恢复的路径上。为了在不付出昂贵微调代价的情况下克服这一问题,我们从软件调试中汲取灵感——在那里,人们分析执行日志以预先捕获错误。我们提出Trajectory Graph Copilot,一个新颖的框架:通过在潜在动作错误被执行之前加以诊断,充当LLM智能体的“副驾驶”。其核心的Graph Debugger将历史轨迹建模为概率图,并使用图神经网络识别频繁导致失败的序列动作模式。作为一种主动式诊断沙箱,我们的方法对潜在缺陷动作发出早期警告,促使智能体自我纠正。这种执行前错误诊断避免了代价高昂的错误,显著增强智能体成功完成长时程任务的能力。在四个基准、三个LLM智能体上的大量实验表明,通过率平均提升14.69%。

利用轨迹图实现智能体LLM系统的执行前错误诊断:论文配图
图 2:Trajectory Graph Copilot 的整体流程。我们首先收集轨迹。然后,我们使用图形调试器来预测动作错误标签,其中包括将轨迹转换为基于 PGM 的图形并利用基于 GNN 的检测器。最后,我们的框架为代理决策提供外部信息。