论文
CUJBench:从浏览器到后端的跨模式故障诊断 LLM-Agent 基准测试
CUJBench: Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend
摘要
自动故障诊断需要将浏览器可见的症状与后端可观测信号相关联,但现有的基准测试并未评估这种跨模式推理任务。构建一个并不简单:多模式故障场景的注释成本很高,并且实时环境捕获引入了随机性,使得跨运行代理比较不可靠。据我们所知,我们推出了 CUJBench,这是第一个将浏览器可见的故障证据与诊断框架中的后端可观察性相结合的基准测试。 CUJBench 通过具有多代理审查循环和三层注释方案的 LLM 辅助生成管道解决注释成本问题,生成跨五个故障系列的 87 个标记场景,并通过将每个故障打包为具有固定工具接口的确定性多模式快照来确保可重复性。该基准测试在检索、仅浏览器和完整工具集基线下评估了六个前沿模型,总体准确率达到 19.7%,上限为 52%,远低于饱和度。与预期相反,仅浏览器代理总体上优于全工具集代理,扩大的证据访问会导致无重点的探索,而不是改进综合。轨迹分析将跨模式综合确定为主要瓶颈:智能体检索了决定性证据,但未能正确归因——这是所有六个模型中统一的结构限制,仅靠模型规模和更丰富的工具访问无法解决。