论文
软件工程社区中基于 LLM 的心理安全定性编码的即时工程策略:一项受控实证研究
Prompt Engineering Strategies for LLM-based Qualitative Coding of Psychological Safety in Software Engineering Communities: A Controlled Empirical Study
摘要
定性分析在理解软件工程的人类和社会方面发挥着关键作用。然而,它仍然是一个要求很高的过程,由个别研究人员的主观解释和对提示设计等方法选择的敏感决定。 大语言模型 (LLM) 的最新进展为支持此类分析提供了有希望的机会,尽管它们在不同提示条件下再现人类定性推理的可靠性在很大程度上尚未经过测试。本研究提出了对三种 LLM(Claude Haiku、DeepSeek-Chat 和 Gemini 2.5 Flash)的受控实证评估,涉及两种即时工程策略(零样本和多样本封闭编码),使用 Cohen 的 kappa 作为每个配置十次独立运行的主要一致性度量。结果表明,多次提示显着提高了 Claude Haiku 的一致性(Delta kappa = +0.034,Wilcoxon p = 0.004),但对于 DeepSeek-Chat 或 Gemini 2.5 Flash 则没有。模型内稳定性差异很大 - DeepSeek-Chat 和 Claude Haiku 表现出最低的方差(SD 约为 0.017),而 Gemini 2.5 Flash 的稳定性最差(SD = 0.038)。在所有模型中都发现了对“分享负面反馈”的系统性高预测(偏差率高达 5.25 倍),同时对“表达担忧”的一致预测不足。总的来说,这些发现为软件工程研究的 LLM 辅助定性编码中的及时工程指南提供了经验证据。