论文

大语言模型代码安全校准实证研究

An Empirical Study of Security Calibration in Large Language Models for Code

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 正在迅速改变软件开发,但它们在安全关键环境中的使用提出了一个关键问题:模型是否知道其生成的代码何时不安全?此属性称为校准,用于衡量模型的置信度是否与其输出的真实正确性一致。我们在 LLM 生成的代码中提出了第一个大规模的安全校准实证研究。我们在两个互补的基准上跨多个温度设置评估 GPT-4o-mini、Gemini-2.0-Flash 和 Qwen3-Coder-Next:独立的安全任务和多语言存储库级上下文。我们的结果表明,在评估的 LLM 中普遍存在过度自信。功能校准始终比安全校准差,这表明模型估计安全结果比功能正确性更可靠,​​这可能是因为功能正确性取决于复杂的执行行为。我们还研究了校准引导的自动修复是否可以帮助修复 LLM 生成的代码中的漏洞,发现只有有限的改进,同时频繁引入功能回归。此外,我们研究了减少错误信任的不同缓解策略,其中模型为易受攻击的代码分配了高置信度。结果表明,尽管架构门控改进了受控基准的校准,但在实际存储库级别设置中校准却恶化,从而增加了高可信度易受攻击输出的风险。