论文

OpenRCA 2.0:从结果标签到因果过程监督

OpenRCA 2.0: From Outcome Labels to Causal Process Supervision

智能体系统Agent任务评测

摘要

根因分析(RCA)对LLM智能体能力构成整体性检验——如长上下文理解、多步推理与工具使用。但既有数据集存在根本缺口:它们只标注根因——而非连接根因与观测症状的传播路径——这在很大程度上把任务简化为朴素模式匹配。为支持严格评估——我们介绍PAVE——步进式标注协议——利用故障注入的已知干预重建因果传播路径。机制是前向验证:从原因推到结果——而非从症状反向推断。应用PAVE产出OpenRCA 2.0(500实例)——首个带步进因果标注的跨系统RCA基准。跨11个前沿LLM——恢复精确根因集合平均仅在20.7%的案例中成功。为定位困难所在——我们放宽标准并发现所谓的无锚定诊断:智能体在76.0%的案例中识别至少一个正确根因服务——但仅61.5%把该服务锚定到通往观测症状的经证因果传播路径。仅结果的评估掩盖该失败模式;步进因果真值是可信LLM RCA智能体的缺失拼图。

OpenRCA 2.0:从结果标签到因果过程监督:论文配图
图 1:对 Seat 服务中运行的 NetworkDelay 故障的毫无根据的诊断。根据已知的干预(上),PAVE 重建经过验证的因果路径 Seat→\toTravel→\toOrder→\toGateway(中)。代理指出了正确的根本原因,但生成了一个跳过旅行的图表(底部):仅结果评估将其评分为成功,而过程级评估则显示了缺失的边缘。