论文

TraceGraph:用于诊断与改进智能体轨迹的共享决策图景

TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories

智能体系统Agent任务评测

摘要

智能体基准越来越多地记录丰富的交互轨迹,但评估往往把每次rollout简化为通过率或奖励分数。我们提出TraceGraph,一个基于图的框架,将公开的多模型智能体轨迹转变为共享决策图景。对每个任务,TraceGraph在引入模型身份之前,先基于汇集的rollout在可观测的动作-观察状态之上构建图。随后叠加由结果信息标注的高产核心区与陷阱区,并用三个事件概括每次rollout:进入(Access)、陷阱暴露(Trap exposure)与修复(Repair)。在横跨五个基准划分的轨迹上,TraceGraph画像揭示了被聚合分数掩盖的导航差异,并表明不同划分在奖励避开陷阱还是从陷阱中恢复上有所不同。同一TraceGraph图景还催生了面向SWE-bench的陷阱感知恢复流水线:运行时检测器在与历史陷阱区域匹配的状态上触发,然后从同一前缀出发评估轻量级续接策略。在触发的状态上,最佳汇集单因子策略将官方解决率在按提供方划分的触发子集上从40.4%提升到43.5%,在共同触发实例上从41.0%提升到44.8%,且活跃组件因提供方而异。总体而言,TraceGraph提供了一套过程词汇,用于追问智能体基准究竟在测什么、模型在共享图景上的何处分歧,以及失败区域如何指导下游改进。

TraceGraph:用于诊断与改进智能体轨迹的共享决策图景:论文配图
图 1:通过率可以隐藏流程多样性。左:三个模型在同一基准测试中得分在 3 分以内。右:在由池化部署构建的共享决策环境中,他们遵循不同的路径:通过修复进行广泛探索,避免浅层陷阱,或者通过更多陷阱暴露进行高访问导航。