论文

TelemetrySuffBench:Agent遥测足以诊断故障根源吗?

TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis?

模型评测基准与评测资源

摘要

智能体系统日益暴露执行轨迹,然而揭示故障发生的遥测仍可能不足以定位故障源自何处。我们提出TelemetrySuffBench,一个受控基准,将故障检测、故障源定位与证据不足下的安全弃权分离开来。该基准构建了带延迟绑定故障的规范化多组件轨迹,并将其呈现为成对的粗粒度视图、七因子遥测掩码和精确相等的歧义来源对。我们用统一协议、显式候选集、无效输出核算、子组分析和冻结盲留出集评估五个前沿语言模型。在完整遥测下,各模型的来源步Top-1准确率介于33.8%到97.2%之间。元数据、OpenTelemetry兼容与OpenInference兼容视图在保持99.5%到100%检测F1的同时,将来源步准确率限制在至多0.5%,暴露出一个稳健的检测-定位差距。因子消融进一步表明,移除决策内容会使所有模型的来源步准确率降为零,而移除溯源信息也会造成大的模型相关损失。在需要弃权的富歧义输入上,证据门控使三个模型的无依据唯一来源答案减少12.5至48.6个百分点,而两个模型仍对每个案例作答,暴露出安全弃权上的强烈模型依赖。冻结留出集上的结果在同一生成器家族内复现了核心模式。这些发现表明,终结状态可以支撑检测,而可靠的因果归因需要显式的决策到溯源链接,以及跨模型有效的弃权保障。数据集与基准实现可在 https://anonymous.4open.science/r/TelemetrySuffBench-E635/README.md 获取。