论文

炒作与现实:大语言模型 作为 Simulink-Stateflow 模型基于搜索的自动化程序修复中的变异器

Hype Meets Reality: Large Language Models as Mutators in Search-based Automated Program Repair of Simulink-Stateflow Models

模型评测模型能力评测

摘要

基于搜索的自动程序修复(APR)技术依赖于精心设计的变异算子来探索候选修复的空间。 大语言模型 (LLM) 的最新进展表明,生成模型可以通过动态建议修复来取代此类运算符。在本文中,我们在 Simulink/Stateflow 中建模的网络物理系统 (CPS) 背景下研究了这一假设。我们通过用 LLM 生成的突变替换其突变算子的子集来扩展最先进的 FlowRepair 方法,从而实现更灵活和更具表现力的补丁生成。我们在跨四个 CPS 域的 19 个现实世界错误 Stateflow 模型的基准上评估了该方法,使用与 FlowRepair 相同的实验设置在相同的挂钟预算下进行受控比较。与预期相反,在该对照评估中,基于 LLM 的突变显着降低了 FlowRepair 实验设置下的修复性能。在测试的 LLM 变体中,基于 LLM 的修复为 4-6 个模型生成了合理的补丁,为 4 个模型生成了有效的补丁,而原始方法分别为 18 和 16 个模型。我们的分析表明,在这种集成中,LLM 难以进行精确的符号编辑,缺乏行为反馈,并生成阻碍有效探索的嘈杂搜索空间。这些发现并没有显示 LLM 对于 APR 的一般局限性,而是强调了将 LLM 简单地集成到基于搜索的 APR 中的基本局限性,并激发了将结构化突变与生成指导相结合的混合方法。