论文

冗余还是必要?智能体轨迹冗余步骤检测基准

Redundant or Necessary? A Benchmark for Detecting Redundant Steps in Agent Trajectories

智能体系统Agent任务评测

摘要

基于LLM的智能体已展现出通过多步推理与工具使用解决复杂任务的强大能力。然而,现有评估协议主要关注任务成功与否,忽视了智能体行为的一个关键方面:执行效率。在实践中,智能体轨迹往往包含冗余步骤,这些步骤消耗大量资源却对任务完成贡献甚微。本工作提出并界定了一个新的研究方向:智能体轨迹中的冗余步骤检测。为支撑这一方向,我们提出RedundancyBench,一个包含多样化任务与精心标注轨迹的新基准,其中每一步都根据其对任务完成的贡献进行标注。基于RedundancyBench,我们开发并评估了3种代表性方法,以回答轨迹中的某一步是冗余还是必要。结果显示,即便表现最好的方法在检测冗余步骤上也仅获得24.88%的分数,而有些方法的表现甚至低于随机猜测。这些结果凸显了该任务的复杂性以及在该领域开展进一步研究的必要性。(本文的代码与数据集均可在 https://anonymous.4open.science/r/RedundancyBench 获取。)

冗余还是必要?智能体轨迹冗余步骤检测基准:论文配图
图 1:代理轨迹中冗余步骤的示例。步骤 tt 是重复步骤,因为工具调用及其结果与步骤 0 中的相同,没有带来任何新信息。步骤TT为异常步骤,由于网络错误导致工具调用失败。