论文
冗余还是必要?智能体轨迹冗余步骤检测基准
Redundant or Necessary? A Benchmark for Detecting Redundant Steps in Agent Trajectories
摘要
基于LLM的智能体已展现出通过多步推理与工具使用解决复杂任务的强大能力。然而,现有评估协议主要关注任务成功与否,忽视了智能体行为的一个关键方面:执行效率。在实践中,智能体轨迹往往包含冗余步骤,这些步骤消耗大量资源却对任务完成贡献甚微。本工作提出并界定了一个新的研究方向:智能体轨迹中的冗余步骤检测。为支撑这一方向,我们提出RedundancyBench,一个包含多样化任务与精心标注轨迹的新基准,其中每一步都根据其对任务完成的贡献进行标注。基于RedundancyBench,我们开发并评估了3种代表性方法,以回答轨迹中的某一步是冗余还是必要。结果显示,即便表现最好的方法在检测冗余步骤上也仅获得24.88%的分数,而有些方法的表现甚至低于随机猜测。这些结果凸显了该任务的复杂性以及在该领域开展进一步研究的必要性。(本文的代码与数据集均可在 https://anonymous.4open.science/r/RedundancyBench 获取。)
