论文
从成功之流追踪智能体失败
Tracing Agentic Failure from the Flow of Success
摘要
基于LLM的智能体系统的失败归因——识别失败轨迹中哪些步骤导致任务失败——对调试与改进这些系统至关重要。既有方法要么依赖基于提示的管线(计算昂贵),要么需要在带步级错误标注的失败轨迹上后训练(收集昂贵、难以规模化)。我们主张实用的失败归因模型应轻量、且无需步级监督即可在失败数据上训练。为此我们解决无监督失败归因:仅在成功轨迹上训练、推理时对给定失败轨迹识别错误步骤。我们提出OAT:把该问题建为带神经控制微分方程的单类学习——在潜空间建模成功轨迹的动力学模式。推理时,失败轨迹的每一步按其对成功轨迹所学动力学的偏离获得异常分,进而构成错误步骤集。仅在100条成功轨迹上训练:实验显示OAT较基于提示的基线快200–5,000倍,同时在域内与分布外数据集上一致超越它们(F1分别+20%与+7%)——证明OAT是诊断智能体系统失败的有前景且高效的方向。
