论文
RAG-Reflect:代理检索增强生成以及堆栈溢出上注释驱动代码维护的反射
RAG-Reflect: Agentic Retrieval-Augmented Generation with Reflections for Comment-Driven Code Maintenance on Stack Overflow
摘要
Stack Overflow 等在线编程平台上的用户评论对于维护共享代码示例的正确性和相关性起着至关重要的作用。然而,大多数评论表达了感谢或澄清,而只有一小部分强调了可推动有意义的编辑的可操作问题。本文展示了代理人工智能原理如何通过提出 RAG-Reflect 来彻底改变软件维护任务,RAG-Reflect 是一个模块化框架,无需特定任务的训练即可实现有效评论编辑预测的微调级别性能。有效评论编辑预测(VCP)是确定用户评论是否直接触发后续代码编辑的任务。该框架将 大语言模型 (LLM) 与检索增强推理和自我反思机制集成在一起。 RAG-Reflect 通过基于一次性模式分析阶段构建的三阶段运行时工作流程进行操作。在初始化期间,解释模块分析知识库以生成验证规则。在推理时,系统 (1) 检索上下文示例,(2) 关于评论编辑因果关系的原因,以及 (3) 使用预先建立的规则反思决策。我们在公开的 SOUP 基准上评估 RAG-Reflect,达到 Precision = 0.81、Recall = 0.74 和 F1 = 0.78,优于传统基线(例如 Logistic 回归、XGBoost、不同的提示技术),并且非常接近未经重新训练的微调模型 (F1 = 0.773) 的性能。我们的消融和阶段级分析表明,检索和反射模块都显着提高了性能。