论文
现实世界软件开发中主动编码助手的实证研究
An Empirical Study of Proactive Coding Assistants in Real-World Software Development
摘要
基于 大语言模型 (LLM) 的编码助手已经取得了实质性进展,但大多数系统仍然处于被动状态,需要开发人员明确制定他们的需求。主动编码助手旨在从集成开发环境 (IDE) 交互和存储库上下文中推断潜在的开发人员意图,从而减少交互开销并支持更无缝的协助。然而,由于缺乏大规模的现实世界开发者行为数据,这一方向的研究受到限制。因此,现有的研究通常依赖于 LLM 模拟的 IDE 跟踪,其对真实开发行为的保真度仍不清楚。在本文中,我们通过大规模实证研究来调查这种模拟与现实的差距。我们使用自定义 Visual Studio Code 扩展连续三天从 1{,}246 位经验丰富的行业开发人员那里收集真实的 IDE 交互跟踪,并构建配对的 LLM 模拟跟踪以进行受控比较。我们的分析表明,模拟痕迹在行为多样性、时间结构和探索模式方面与真实痕迹有很大不同。根据收集的数据,我们引入了 \textbf{ProCodeBench},这是主动意图预测的现实基准。使用代表性 LLM、检索增强方法和代理基线进行的实验表明,当前方法在真实 IDE 跟踪下仍然远不可靠,这表明基于模拟的评估可能会高估现实世界的性能。最后,我们的训练研究表明,模拟数据不能替代真实数据,但在现实世界 微调 之前使用时可以对其进行补充。这些发现凸显了真实的开发人员行为数据对于评估和训练主动编码助理的重要性。