论文

UNBIND:用推理时方向干预降低代码知识再现

UNBIND: UNlearning By INference-time Directional Steering for Code LLMs

模型训练模型编辑与遗忘

摘要

代码大语言模型从大型代码语料库中获取编程能力,但也可以记住以后需要删除的实现。当出现版权或安全问题时,需要忘记代码来控制它们的继续复制。然而,目标代码和保留代码共享计算模式,从而在忘记特定实现和保留通用编程能力之间产生了紧张关系。我们提出了 UNBIND,一个代码去学习框架,它单独考虑哪些隐藏状态对应于目标代码以及如何抑制其再现。通过为这些目标构建单独的方向,UNBIND 在保持模型权重固定的同时实现了推理时的选择性取消学习。我们的评估涵盖了两个代码模型和两个语料库的十四个基线。 UNBIND 在每种情况下都获得了最高的联合遗忘和效用得分。根据 F-BLEU 的测量,它减少了目标代码再现 97.3% 到 99.1%,与原始模型相比,最多减少了两个 HumanEval+ 和六个 MBPP+ 问题的解决。在固定预算下的重复提取测试中,产生至少 50 个词元的精确跨度的目标数量从每个设置 300 个中的 188--262 个下降到 0--2 个。提取的跨度没有达到 100 个 token,平均最佳恢复率范围为 0.43\% 到 6.45\%。多语言和相关代码评估进一步表明有效遗忘对有用编程能力的影响有限,支持 UNBIND 作为选择性代码遗忘的实用方法。