论文
DynSTEER:面向智能体的动态阶段式轨迹评估与执行时审查
DynSTEER: Dynamic Stage-wise Trajectory Evaluation and Execution-time Review for Agents
摘要
大语言模型智能体被越来越多地用于长时域任务执行,引发轨迹评估中的粒度问题:全轨迹验证过于粗粒度,无法捕捉长轨迹中的具体失败及其证据;而单步评分过于细粒度,易受噪声干扰且计算开销大。现有单参考轨迹范式难以评估智能体执行路径的丰富空间,也延迟了及时反馈和早期终止。为解决这些问题,我们提出DynSTEER,一种动态阶段式智能体轨迹评估框架。DynSTEER通过阶段式动态评估,在关键执行节点分割轨迹,并根据阶段级结果动态调整多层级审查策略;它从公开任务视图中构建容错里程碑图,以保留多样合法路径且避免参考泄露;同时支持终止不可恢复的智能体执行,以减少资源浪费。实验表明,DynSTEER相比原生评估提升了85.2%的评估判别力,能显著区分所有模型对,且在失败轨迹上节省了45.41%的执行步骤。
