论文

Bug 解决中的语义漂移:行为信号如何从报告传播到测试和补丁

Semantic Drift in Bug Resolution: How Behavioral Signals Propagate from Reports to Tests and Patches

模型评测评测方法与指标

摘要

Desc2Fix 是一个用于测量错误报告、触发测试和开发人员编写的修复之间的语义一致性的框架。对齐是通过结构化行为锚点(例如,再现步骤、API/异常提示、预期行为与实际行为)、确定性相似性度量(ROUGE、SBERT、CodeBERT、OpenAI 嵌入)以及基于覆盖率、正确性和特异性的基于 LLM 的判断来实现的。我们的分析涵盖了来自 Defects4J 和 SWT-Bench 的 2,857 个报告测试补丁三元组,使用来自不同模型系列的两个广泛采用的指令调整 LLM。 LLM 可靠地提取结构化信号(完整性高达 90%)并表现出强大的跨模型一致性,为下游推理产生稳​​定的语义输入契约。然而,对齐是高度表示敏感的:仅词汇相似性是不够的,完整的差异为判断报告补丁对应关系提供了最稳定的基础,而结构化摘要则在个体操作和实体层面上交换了表面重叠以获得更强的对应关系。在超过 182,000 个基于 LLM 的对齐判断中,两个模型都表现出相对于人类的系统乐观性(5 分制中的 1-2 分),并且只有适度的排名一致性,从而激发了偏见意识评估。行为对齐是可测量的,但不能简化为相似性,并且结构化锚点与基于嵌入的代理相结合,为排序和过滤测试和补丁提供可重现的信号。 Desc2Fix 可以支持更可靠的测试生成、故障定位、补丁排名和错误报告编写。