论文

OTAP:面向智能体轨迹规划与执行评估的结构感知最优传输

OTAP: Structure-Aware Optimal Transport for Evaluating Planning and Execution in Agent Trajectories

智能体系统Agent任务评测

摘要

大语言模型智能体通过生成规划、工具调用与中间结果交织的轨迹来解题。当前评估指标把这类轨迹压缩为二元成功标志、与参考做精确匹配比较、或把判断委托给另一个语言模型。成功标志无法区分可靠的解与凭运气成功的解,也不说明一次失败运行为何出错。精确匹配惩罚那些有效但重排或分解方式不同于参考的计划。我们把轨迹评估重构为智能体执行图与一组有效解图之间的距离,并通过属性化依赖图上的非平衡融合Gromov-Wasserstein传输问题实例化。所得分数OTAP(智能体规划的最优传输)是一个伪度量:对保依赖的重排可证明不变,对冗余步骤的敏感度有界。其非平衡边际无需强制匹配即可处理缺失或幻觉步骤,软耦合则容纳计划粒度变化。在受控扰动与三个公开基准上,OTAP在纯语义指标低于随机水平的区间内区分有效与无效轨迹;其优势随依赖图的保真度变化——边来自算子语义时最大,边从自由文本推断时最小。存在形式化验证器时,严格的表面指标比OTAP更能预测有效性,OTAP因此适用于没有验证器的开放式领域。