论文
Agent错误数据集:扩展 50,000 个错误诊断对,用于故障分析和错误感知后训练
Agent Error Dataset: Scaling 50,000 Error--Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training
摘要
不成功的 LLM Agentrollout包含比最终奖励更多的信息:Agent可用的观察结果、它选择的操作以及环境的响应。重用这些经验进行学习需要确定修改和测试具体替代方案的决定。我们引入了Agent错误数据集 (AED),其中包含来自 33 个环境、19 个Harness系列和基于文本的Agent系统中的 23 个策略模型的 9,961 个源任务的 50,228 个错误诊断对。我们保留源跟踪和执行元数据,以支持跨设置故障分析和重新诊断,而无需重复原始部署。我们的五阶段 Agentic 错误训练 (AET) 管道收集自然故障,生成诊断和建议的纠正措施,并根据记录的证据进行检查。在支持重播的情况下,我们将更正与匹配执行设置下同一检查点的原始操作重试进行比较。然后,我们为诊断和演员恢复构建单独的训练视图。在 3,062 个匹配的重放对中,第一个提案修正将验证者的通过率从 18.4% 提高到 51.1%,提高了 32.7 个百分点。使用单独冻结的诊断版本,对 1,656 个源任务进行全面诊断微调,将 Qwen3-8B 与内部教师标签的精确步骤一致性从 47.2% 提高到 63.6%,这是 943 个案例中三个种子的平均值。此比较中最强的提示参考分数为 54.7%,并且在四个增加的训练集大小中的每一个中,平均一致性都有所提高。在演员训练方案的单种子比较中,仅行动修复训练在 WebShop-lite 上的得分比仅成功训练高 6.67 个百分点。