论文

当更好的转弯并不能造就更好的客服人员时:诊断下一转弯指标与工作流程成功之间的差距

When Better Turns Do Not Make Better Agents: Diagnosing the Gap Between Next-Turn Metrics and Workflow Success

智能体系统Agent任务评测

摘要

代理模型经常一次评估一个决策,其中模型根据黄金交互历史记录预测下一步行动,该历史记录根据参考进行评分。我们研究该协议下的改进是否可以预测自主工作流程执行的改进。我们在多轮客户支持工作流程中研究了 4B 和 14B 参数的前 SFT 和监督微调 (SFT) Qwen3 模型以及 4B 和 12B 参数的 Gemma 3 模型。我们发现,SFT 持续提高了文本转向成功率,并且在黄金历史评估下,每个模型的总体下一转向成功率都会增加。然而,这些改进并没有转移到自主工作流程执行上。特定于工具的收益也因指标和模型而异。在整体工作流评估下,四个 SFT 模型均未取得成功,严格的轨迹完成最多达到 10.4% 的工作流成功率。我们的结果表明,下一回合评估并不是工作流程成功的可靠代表,因此需要单独报告文本质量、本地操作正确性、工具执行和端到端任务完成情况。