论文
PromptAudit:审计基于LLM的漏洞检测中的提示敏感度
PromptAudit: Auditing Prompt Sensitivity in LLM-Based Vulnerability Detection
摘要
大语言模型 越来越多地用于漏洞检测,但其在不同提示形式下的可靠性仍未得到表征。我们提出了 PromptAudit,一个受控评估框架,通过修复数据集、解码和解析来隔离提示效果,同时仅改变提示策略。我们在 1,000 个 CVE(涵盖 16 种编程语言的 6,074 个代码示例)上使用五个开放权重模型的五种提示策略,评估准确性、召回率、弃权率、覆盖率和有效 F1。我们发现标准的思想链提示实现了最强的整体操作性能,而少样本提示提供了依赖于模型的好处,这对于提示敏感的模型来说最为明显。相比之下,适应性思维链经常抑制回忆,而自我一致性会导致过度放弃,从而急剧降低有效绩效。这些结果表明,漏洞检测行为是由模型和提示共同决定的,提示敏感性是一流的系统属性,必须在评估和部署中明确表征。