论文
使用证据引导推理提示减轻代码异味检测中的 LLM 谄媚行为
Mitigating LLM Sycophancy in Code Smell Detection Using Evidence-Guided Reasoning Prompts
摘要
大语言模型 (LLM) 由于具有解释程序语义的能力,越来越多地用于代码气味检测任务。然而,它们在这种情况下的可靠性仍然没有得到很好的探索,特别是在不同的提示条件下,模型预测可能受到外部线索而不是代码特征的影响。其中一个限制是阿谀奉承偏差,即模型倾向于将其输出与用户提供的假设相一致,而不是进行客观分析。在本文中,我们首次对基于 LLM 的代码气味检测中的阿谀偏见进行了系统的实证研究。使用 MLCQ 数据集,我们评估不同的提示框架(例如确认偏差、矛盾提示和错误前提)如何影响模型预测。我们的结果表明,LLM 对提示变化高度敏感,决策翻转率高达 72%,错误对齐率超过 90%,表明存在很大的不稳定性并与误导性提示相符。为了解决这个问题,我们提出了证据引导去偏提示(EGDP),这是一种强制证据优先推理的结构化提示策略。 EGDP 降低了决策的不稳定性并提高了鲁棒性,将决策翻转率降低至 12%,错误对齐率降低至 21%,同时增加了对结构性证据的依赖。我们的研究结果表明,阿谀奉承偏见对基于 LLM 的代码气味检测的可靠性构成了严重威胁,而证据引导的推理提供了一种有效且可推广的缓解方法。