论文

及时质量和 Pull Request 结果:LLM 辅助开发的阶段性实证研究

Prompt Quality and Pull Request Outcomes: A Stage-Based Empirical Study of LLM-Assisted Development

摘要

大语言模型 (LLM) 支持的工具(例如 ChatGPT)越来越多地用于协作软件工程工作流程,但对于提示结构如何影响下游拉取请求 (PR) 结果却知之甚少。先前的研究主要考察对话的帮助性、生产力或粗粒度的采用指标,而对提示结构在协作集成行为中的作用了解不够。我们分析了 265 个手动验证的开发人员与 ChatGPT 交互,这些交互源自开源拉取请求中自我承认的 ChatGPT 使用情况。基于之前对面向开发人员的工件和提示工程的研究,我们使用三个维度来操作提示结构:上下文、特异性和验证。我们首先评估 LLM 辅助注释是否可以可靠地再现人类对提示结构的判断,发现跨维度和工作流程上下文的实质性变化。特异性显示与人类判断最稳定的一致性; LLM 系统地强调了上下文;验证仍然难以一致地评估,从而激发了混合人类 LLM 注释策略。然后,我们使用这个经过验证的框架,研究提示结构如何影响 AI 辅助 PR 工作流程中的可操作代码生成、代码采用和集成深度。特异性和上下文与可操作的代码生成密切相关;验证成为代码采用的主要预测因素;集成深度与上下文密切相关。总的来说,我们的研究结果表明,提示特征在人工智能辅助的软件工程工作流程中发挥着独特的、阶段相关的影响,通过上下文证据利用、任务特异性和可评估性线索影响下游的采用和集成。