论文
从程序切片到因果清晰:通过上下文分区和 LLM-as-a-Judge 评估忠实、可操作的 LLM 生成的故障解释
From Program Slices to Causal Clarity: Evaluating Faithful, Actionable LLM-Generated Failure Explanations via Context Partitioning and LLM-as-a-Judge
摘要
基于 大语言模型 (LLM) 的调试系统可以生成故障解释,但这些解释可能不完整或不正确。误导性的解释对下游任务(例如错误分类、错误修复)有害。我们研究了各种 LLM 上下文配置如何影响解释质量。现有的工作主要将 LLM 生成的故障解释视为调试或修复工作流程的临时副产品,对代码、测试和错误消息等无差异的工件使用通用提示,而不是将解释作为具有专门质量评估的一流输出。因此,现有方法对于评估这些解释是否捕获了潜在的错误-错误-失败机制以及可操作的后续步骤提供了有限的支持,并且大多数技术反而优先考虑任务成功(例如补丁正确性或审查质量)而不是明确的因果解释质量。我们系统地改变调试信息,以研究不同的上下文组合如何影响 LLM 生成的故障解释的质量。在关于真实错误的 93 个上下文配置和三个经济上可行的模型(gpt-5-mini、DeepSeek-V3.2 和 Grok-4.1-fast)中,我们使用六个标准评估解释,并根据用户研究中的人类评分验证 LLM 作为法官的分数。我们的结果表明,解释质量受到上下文构成的因果影响。证据丰富、特定于失败的工件可以提高因果关系和以行动为导向的质量,而过大的上下文往往会产生模糊的解释。较高的解释得分四分位数与较高的下游修复通过率相关,并且对于某些模型而言,修复更接近参考最小修复。相反,低分四分位数甚至可能低于无解释基线。复制包是公开可用的。