论文

TIDE:对LLM智能体测试时改进的基于轨迹的诊断评估

TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

自主LLM智能体的最新进展表明,它们能够通过与环境的迭代交互提升性能。我们将这一范式定义为测试时改进(Test-Time Improvement,TTI)。然而,TTI如何以及为何成功或失败的机制仍知之甚少,现有评估指标也无法刻画其任务优化效率、错误行为后的适应情况,以及工作记忆对任务完成的具体效用。为填补这些空白,我们提出测试时改进诊断评估(TIDE),一个与智能体和环境无关的框架,将TTI分解为三个全面且相互关联的维度。该框架测量(1)任务完成的整体时间动态,并识别性能主要受(2)递归循环行为还是(3)沉重的累积记忆所制约。在跨多种智能体与环境的大量实验中,TIDE揭示出提升智能体性能需要的不仅仅是扩大内部推理规模,还需要显式优化智能体与环境之间的交互动态。

TIDE:对LLM智能体测试时改进的基于轨迹的诊断评估
图1:我们基于轨迹的诊断评估框架概览。(a)智能体通过与环境的多轮交互完成任务。(b)收集交互轨迹用于诊断分析。(c)TIDE 通过三个互补的指标对 TTI 轨迹提供统一且相互关联的诊断。AUV 通过沿轨迹聚合梯形子面积来量化优化效率;LR 区分循环导致的停滞与行为适应;MI 分离并分析工作记忆的贡献。