论文

超越任务成功:度量LLM智能体支付系统中的工作流保真度

Beyond Task Success: Measuring Workflow Fidelity in LLM-Based Agentic Payment Systems

智能体系统Agent HarnessAgent任务评测

摘要

基于LLM的多智能体系统日益部署于支付工作流,但主流指标——任务成功率(TSR)与智能体交接F1(HF1)——只捕捉最终结果或无序路由决策。我们提出智能体成功率(ASR):一个轨迹保真度指标,在转移级别比较观测与预期的智能体执行序列,把性能分解为转移召回与转移精确。应用于支付分层多智能体系统(HMASP)跨18个LLM与90,000任务实例,ASR揭示:18个模型中10个在支付结账时系统性跳过确认检查点——这一偏差对TSR与HF1均不可见——而8个模型完美执行检查点。值得注意的是,GPT-4.1在TSR与HF1满分的同时暴露隐藏工作流捷径,而GPT-5.2取得完美ASR。由ASR诊断引导的提示精化与确定性路由护栏带来可观TSR改进,对既往挣扎的模型增益最高+93.8个百分点,证明轨迹级评估在受监管领域必不可少。