论文
DeepGuard:通过多层语义聚合安全代码生成
DeepGuard: Secure Code Generation via Multi-Layer Semantic Aggregation
摘要
用于代码生成的 大语言模型 (LLM) 可以从其训练数据中复制不安全的模式。为了缓解这种情况,安全强化的常见策略是使用从最终 Transformer 层派生的监督来微调模型。然而,这种设计可能会遇到最后一层瓶颈:漏洞判别线索可以跨层分布,并且在针对下一个词元预测优化的输出表示附近变得不易检测到。为了诊断这个问题,我们执行分层线性探测。我们观察到,与漏洞相关的信号在中层到上层的频带中最容易检测到,但向最后层衰减。受这一观察的启发,我们引入了 DeepGuard,这是一个框架,通过基于注意力的模块聚合来自多个上层的表示,从而利用分布式安全相关线索。聚合信号为多目标训练目标中的专用安全分析器提供动力,平衡安全性增强和功能正确性,并进一步支持轻量级推理时间引导策略。针对五个代码 LLM 的广泛实验表明,与 SVEN 等强基线相比,DeepGuard 将安全正确的生成率平均提高了 11.9%。它还保留了功能的正确性,同时展示了对保留漏洞类型的泛化。我们的代码在 https://github.com/unknownhl/DeepGuard 上公开。