论文

DynSTEER:面向智能体的动态阶段式轨迹评估与执行时审查

DynSTEER: Dynamic Stage-wise Trajectory Evaluation and Execution-time Review for Agents

智能体系统Agent任务评测长程任务评测

摘要

大语言模型智能体被越来越多地用于长时域任务执行,引发轨迹评估中的粒度问题:全轨迹验证过于粗粒度,无法捕捉长轨迹中的具体失败及其证据;而单步评分过于细粒度,易受噪声干扰且计算开销大。现有单参考轨迹范式难以评估智能体执行路径的丰富空间,也延迟了及时反馈和早期终止。为解决这些问题,我们提出DynSTEER,一种动态阶段式智能体轨迹评估框架。DynSTEER通过阶段式动态评估,在关键执行节点分割轨迹,并根据阶段级结果动态调整多层级审查策略;它从公开任务视图中构建容错里程碑图,以保留多样合法路径且避免参考泄露;同时支持终止不可恢复的智能体执行,以减少资源浪费。实验表明,DynSTEER相比原生评估提升了85.2%的评估判别力,能显著区分所有模型对,且在失败轨迹上节省了45.41%的执行步骤。

DynSTEER:面向智能体的动态阶段式轨迹评估与执行时审查:论文配图
图1:智能体评估范式比较。(a)传统方法缺少阶段定向上下文,受单一参考答案偏差影响,并浪费步骤等待失败轨迹结束。(b)DynSTEER提供充分上下文进行分阶段定向评估,使用里程碑有向无环图容纳多条有效路径,并提前终止死锁,减少34.51%的浪费步骤。