LogDx-CI:LLM 根本原因诊断的基准日志缩减工具
LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis
摘要
CI 故障日志很大(中位数 5k 行,此语料库中最多 200k)且嘈杂。尝试调试它们的 编码智能体 依赖于上游工具来将日志减少到可管理的上下文,但该领域还没有公开的经验比较哪些减少为下游 LLM 诊断保留了足够的证据。我们引入了 LogDx-CI,这是一个基准测试,它在 35 个真实的 GitHub Actions 失败案例上比较 11 个上下文缩减工具(raw、tail、grep、三种 RTK 模式、两个真实的 LLM 地图缩减总结器、三个混合路由器),由 3 个 LLM 调试器系列(Claude Haiku 4.5、Claude Sonnet 4.6、OpenAI gpt-5-mini)进行评分加上 Sonnet 4.6 工具使用代理。我们报告了三个承重发现。 (1)~混合 grep+tail 路由器主导成本质量帕累托前沿;前两种方法的得分为 0.670 / 0.666,每个案例为 $\sim$ \$0.03,与独立 grep 的质量大致相同,但标记数量减少了 $4.5\times$。 (2)~在代理循环体系中,简化工具的质量范围缩小了 $7\times$(单次传播 0.42 $\to$ 代理循环传播 0.059);代理通过后续工具调用来拯救弱上下文。然而,成本差异仍然存在:弱上下文迫使代理发出 2--4$\times$ 的工具调用才能恢复。 (3)~一个跨家族的 LLM 摘要对(gpt-5-mini 摘要器为 Claude Haiku 调试器提供数据)在四个诊断变体中的平均性能比同族对的优势为 $+0.071$,从而证伪了该任务的自调用偏差假设。 gpt-5-mini 摘要器也是代理循环 \#1 方法(得分 0.749),每个案例的工具调用费用为 $0.37$,并且比 Haiku 摘要器低 $10\times$ 的减速器成本(每个案例 0.18 美元 vs 1.75 美元)。所有数据、代码、每个案例的捆绑包和可重复性基础设施都是公开的。