论文

CoGate:用于安全代码生成的置信门控协同解码

CoGate: Confidence-Gated Co-Decoding for Secure Code Generation

模型推理解码与生成控制

摘要

大语言模型 广泛用于代码生成,但由于从预训练数据中学习到的模式,它们也可能生成不安全的程序。解码时引导已成为该问题的重要解决方案:在每一步将小型专家模型与目标模型相结合以生成更安全的代码,这称为协同解码。然而,现有编码解码方法的接受规则没有考虑专家模型的置信度。当安全专家由于未见的模式或分布外 (OOD) 环境而缺乏信心时,其指导可能会产生误导。为了应对这一挑战,我们提出了 CoGate,一种置信门控编码方法,可根据置信度控制专家对编码过程的影响。我们实施我们的方法,并在多个代码生成基准(HumanEval、安全套件和 CWEval)上跨多个 LLM 后端(CodeGen、DeepSeek-Coder、Qwen-Coder、StarCoder)对其进行评估。我们的方法在多个基准测试中均优于现有的协同解码方法 (CoSec+),在 CWEval 上实现了 Func-Sec@10 高达 12.6% 的增益。