论文

从成功之流追踪智能体失败

Tracing Agentic Failure from the Flow of Success

模型评测评测方法与指标

摘要

基于LLM的智能体系统的失败归因——识别失败轨迹中哪些步骤导致任务失败——对调试与改进这些系统至关重要。既有方法要么依赖基于提示的管线(计算昂贵),要么需要在带步级错误标注的失败轨迹上后训练(收集昂贵、难以规模化)。我们主张实用的失败归因模型应轻量、且无需步级监督即可在失败数据上训练。为此我们解决无监督失败归因:仅在成功轨迹上训练、推理时对给定失败轨迹识别错误步骤。我们提出OAT:把该问题建为带神经控制微分方程的单类学习——在潜空间建模成功轨迹的动力学模式。推理时,失败轨迹的每一步按其对成功轨迹所学动力学的偏离获得异常分,进而构成错误步骤集。仅在100条成功轨迹上训练:实验显示OAT较基于提示的基线快200–5,000倍,同时在域内与分布外数据集上一致超越它们(F1分别+20%与+7%)——证明OAT是诊断智能体系统失败的有前景且高效的方向。

从成功之流追踪智能体失败:论文配图
图 1:燕麦概述。 Oat 学习对隐藏路径进行建模,并通过神经控制微分方程重建成功轨迹的隐藏表示。在推理时,Oat 预测故障轨迹的预期成功路径,并通过实际表示与预期成功路径之间的距离计算出的异常分数来识别故障贡献步骤。