论文

减轻软件工程通用人工智能中即时引发的认知偏差

Mitigating Prompt-Induced Cognitive Biases in General-Purpose AI for Software Engineering

模型评测鲁棒性、公平性与可信度评测

摘要

提示引起的认知偏差是通用人工智能 (GPAI) 系统决策的变化,仅由输入中的偏见措辞(例如框架、锚)而不是任务逻辑引起。在软件工程 (SE) 决策支持(其中问题陈述和需求是自然语言)中,小的措辞变化(例如流行提示或结果揭示)可能会将 GPAI 模型推向次优决策。我们使用 PROBE-SWE 来研究这一问题,这是 SE 的动态基准,它将相同 SE 困境的有偏见和无偏见版本配对,控制逻辑和难度,并针对八个与 SE 相关的偏见(锚定、可用性、跟风、确认、框架、事后诸葛亮、双曲线贴现、过度自信)。我们询问即时工程是否可以减轻实践中的偏差敏感性,重点关注从业者可以在实际环境中应用现成的可行技术。在具有成本效益的 GPAI 系统上测试常见策略(例如,思想链、自我消除偏差),我们发现每个偏差的偏差敏感性没有统计上显着的降低。然后,我们采用 Prolog 风格的推理过程视图:解决 SE 困境需要明确提示中通常隐含的任何背景公理和推理假设(即 SE 最佳实践)。因此,我们假设偏差诱导特征会短路假设引发,从而将 GPAI 模型推向有偏差的捷径。在此基础上,我们引入了一种端到端方法,该方法可以引出最佳实践,并在回答之前将公理推理线索注入提示中,从而将总体偏差敏感性平均降低 51% (p < .001)。最后,我们报告了一项主题分析,该分析揭示了与偏见敏感性升高相关的语言模式,澄清了何时不建议使用 GPAI 来支持 SE 决策,以及未来对策的重点。