论文
TIDE:对LLM智能体测试时改进的基于轨迹的诊断评估
TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents
摘要
自主LLM智能体的最新进展表明,它们能够通过与环境的迭代交互提升性能。我们将这一范式定义为测试时改进(Test-Time Improvement,TTI)。然而,TTI如何以及为何成功或失败的机制仍知之甚少,现有评估指标也无法刻画其任务优化效率、错误行为后的适应情况,以及工作记忆对任务完成的具体效用。为填补这些空白,我们提出测试时改进诊断评估(TIDE),一个与智能体和环境无关的框架,将TTI分解为三个全面且相互关联的维度。该框架测量(1)任务完成的整体时间动态,并识别性能主要受(2)递归循环行为还是(3)沉重的累积记忆所制约。在跨多种智能体与环境的大量实验中,TIDE揭示出提升智能体性能需要的不仅仅是扩大内部推理规模,还需要显式优化智能体与环境之间的交互动态。
