论文

开发人员如何体验通过本地 LLM 生成和评估的代码游览来调试不熟悉的代码库

How Developers Experience Debugging Unfamiliar Codebases with Code Tours Generated and Evaluated by Local LLMs

摘要

代码之旅是交互式入门文档,可指导开发人员完成代码库。 大语言模型(LLM)可以自动合成码游。之前关于代码游览生成的工作尚未研究使用开放权重 LLM 生成和评估的代码游览来调试不熟悉的代码库时的开发人员体验或信任校准。本研究调查了 LLM 编写的开放式代码之旅中组件的属性如何影响开发人员在调试不熟悉的代码库时的体验。我们构建了一个管道,可以根据真实的可重现错误生成和评估代码游览。 26 位具有不同背景的开发人员参与了用户研究。总共 26 个代码游览是根据 2025 年 GitHub 提交中挖掘的真实 Java bug 编写的,每个游览都由两个不同的 LLM 独立判断,从而产生 52 个评估配置。参与者在探索每次旅行时大声思考。三位作者对访谈进行了定性编码,以确定反复出现的主题。开发人员通常更喜欢根据代码长度缩放细节的导览,避免仅仅重述代码,易于浏览,并采用引导语气。然而,有些偏好是相互排斥的,例如祈使语气的使用。堆栈跟踪通常不足以识别开发人员认为相关的所有步骤。开发人员还更信任他们认为是人类编写的描述,而不是他们认为是人工智能生成的描述。最后,LLM 生成的旅游质量注释并不可靠:阿谀奉承、胡言乱语和语无伦次普遍存在。这项工作为未来研究 微调 开放权重模型奠定了基础,该模型用于代码游览生成、个性化生成以适应不同的偏好、选择堆栈跟踪之外的相关步骤、校准用户的信任以避免误用和提高开放权重 LLM 成为更值得信赖的评估者的能力