论文

NeuroFlake:用于片状测试分类的神经符号 LLM 框架

NeuroFlake: A Neuro-Symbolic LLM Framework for Flaky Test Classification

摘要

片状测试对同一版本的代码表现出不确定的通过/失败行为,这对可靠的回归测试提出了重大挑战。虽然 大语言模型 (LLM) 承诺自动进行片状测试分类,但它们常常无法理解片状测试背后的实际逻辑,而是过度拟合表面的文本工件(例如特定的变量名称)。这种语义脆弱性导致现实世界不平衡数据集的泛化能力较差,并且容易受到扰动。在本文中,我们介绍了 NeuroFlake,这是一种新颖的神经符号框架,用于对高度不平衡的真实世界数据集 (FlakeBench) 上的片状测试进行分类。与依赖于脆弱的手动规则和黑盒学习的先前方法不同,NeuroFlake 集成了判别性词元挖掘 (DTM) 模块,以自动发现高保真度、具有统计意义的源代码词元(例如,特定的并发原语或异步等待)。通过将这些强潜在信号直接注入 LLM 的注意力机制,我们弥合了神经直觉和符号精度之间的差距。我们的实验表明,神经符号融合通过利用分类 F1 分数至 69.34% 显着提高了分类性能,而现有技术显示最佳 F1 分数为 65.79%。然而,我们通过对抗性压力测试严格评估 NeuroFlake 的稳健性,引入语义保留增强(例如,死代码注入、变量重命名)。虽然基线模型在扰动测试中表现出 8-18 个百分点 (pp) 的性能下降,但 NeuroFlake 在未见的增强上保持了性能稳定性,仅下降了 4-7 个百分点。