论文

模型还是Harness?以交互为中心定位Agent故障

Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures

智能体系统Agent HarnessAgent任务评测

摘要

现有的评估往往将代理失败简化为系统级结果,掩盖了故障的起源以及哪种干预措施可以改善代理系统。这导致了一个修复-分配问题:同一个可见的失败可能需要模型后训练、挂载工程、环境设计或基准修复,取决于其来源。因为代理行为由模型之间的交互、用户、工具、记忆和环境组成,所以结果级别的标签往往不足以改进。大多数失败分类法都没有解决这个问题,因为它们是基准特定的,缺乏共享结构。我们引入了一个交互中心化的分类法,将失败定位到它们起源的交互中,并识别负责的组件。它将41个失败模式分配到两个组件之间的边和一个故障侧,表示修复的位置。这使得分类法变得行动化:模型侧的失败指出后训练的目标,挂载侧的失败指向支架和工具集成的修复,环境或评分器的失败揭示需要重新设计的评价条件。这个结构适用于代理架构,从编码助手到长期时间跨度的个人助理和多代理系统。我们用公开基准、模型系统卡、发表报告和记录的代理轨迹来验证这个分类法,并用独立推理的代理作为评判者进行评估。在四个前沿模型上,最强的评判者达到Cohen's κ=0.76,表明类别捕捉到共享结构,而不是标注者特定的偏好。

模型还是Harness?以交互为中心定位Agent故障:论文配图
图1:放射状交互图。模型位于中心,用户、Harness 和环境三类位于内环,具体组件位于外环。每次失败以两个组件之间的一条边表示。由于模型通过自身 Harness 与另一个模型交互,模型间交互与上下文、记忆、工具一并归入 Harness 类;外环中的另一模型按其角色标为同伴或子智能体。