论文
ConceptCoder:通过概念学习改进代码推理
ConceptCoder: Improve Code Reasoning via Concept Learning
摘要
大语言模型 (LLM) 在软件工程应用中显示出了有希望的结果,但在漏洞检测 (VD) 等代码推理任务中仍然遇到困难。我们引入 ConceptCoder,这是一种模拟人类代码检查的 微调 方法:训练模型首先识别代码概念,然后根据这些概念进行推理。在之前的工作中,通过多模态模型或 LLM 提取概念来解释视觉和自然语言模型。我们的工作首先是为代码制定概念。我们将代码概念定义为人类可理解的代码语义属性,并训练模型来学习这些概念。我们的评估表明,这种方法显着提高了 VD 精度,与 9 个开源 LLM 相比,F1 平均从 66.32 提高到 72.15。与最先进的 (SOTA) 基准相比,ConceptCoder 实现了最佳的 VD 性能,包括微调的 SOTA 开源 LLM 和提示的专有模型,例如 GPT-5.2 和 Claude-Opus-4.5。我们的方法还可以扩展:从四种类型的漏洞定义的概念有利于具有 134 个 CWE 的通用漏洞数据集。我们进一步证明基于概念的 微调 可以推广到 VD 之外并改进分支预测。我们在 https://figshare.com/s/1decab8232c653b44f71 发布了我们的代码和数据集。