论文

从评估到优化:Python 中 CWE 预测的层次结构感知训练信号

From Evaluation to Optimisation: Hierarchy-Aware Training Signals for CWE Prediction in Python

模型训练强化学习

摘要

最初的 ALPHA 基准引入了一种分类感知惩罚,用于评估 Python 中的 CWE 级漏洞预测,并提出该惩罚理论上也可以用作训练信号。本文提供了这种验证。我们比较了三种交付机制:有监督的 微调、双头分类损失以及从标准化惩罚中获得密集奖励的强化学习。我们发现,在分布偏移下,监督方法始终回归到零样本基线以下,而 GRPO 却取得了成功。我们的最佳策略将 Qwen2.5-Coder-7B 在安全强化和对抗性测试 (SVEN) 数据集上的累积 ALPHA 惩罚在贪婪解码下减少了 27.9%,在采样解码下减少了 25.5%(p = 0.005,Welch 的 t 检验),达到了与其 4.5 倍大的零样本教师的统计同等性。我们的结论是,分层惩罚作为训练信号的价值很大程度上取决于其传递的直接性。