论文
TraceGraph:用于诊断与改进智能体轨迹的共享决策图景
TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories
摘要
智能体基准越来越多地记录丰富的交互轨迹,但评估往往把每次rollout简化为通过率或奖励分数。我们提出TraceGraph,一个基于图的框架,将公开的多模型智能体轨迹转变为共享决策图景。对每个任务,TraceGraph在引入模型身份之前,先基于汇集的rollout在可观测的动作-观察状态之上构建图。随后叠加由结果信息标注的高产核心区与陷阱区,并用三个事件概括每次rollout:进入(Access)、陷阱暴露(Trap exposure)与修复(Repair)。在横跨五个基准划分的轨迹上,TraceGraph画像揭示了被聚合分数掩盖的导航差异,并表明不同划分在奖励避开陷阱还是从陷阱中恢复上有所不同。同一TraceGraph图景还催生了面向SWE-bench的陷阱感知恢复流水线:运行时检测器在与历史陷阱区域匹配的状态上触发,然后从同一前缀出发评估轻量级续接策略。在触发的状态上,最佳汇集单因子策略将官方解决率在按提供方划分的触发子集上从40.4%提升到43.5%,在共同触发实例上从41.0%提升到44.8%,且活跃组件因提供方而异。总体而言,TraceGraph提供了一套过程词汇,用于追问智能体基准究竟在测什么、模型在共享图景上的何处分歧,以及失败区域如何指导下游改进。
