论文
哪些神经元识别恶意代码?LLM安全知识的探测研究
Which Neurons Detect Malicious Code? A Probing Study of LLM Security Knowledge
摘要
大语言模型广泛用于代码补全、修复与漏洞检测,但如何在内部识别恶意或脆弱代码仍不清楚。本文研究恶意软件检测行为编码在哪些前馈网络FFN神经元中,并通过因果干预核验归因。作者在Llama3.1-8B-Instruct、Mistral-v0.3-7B-Instruct及Qwen2.5-7B-Instruct上使用机制可解释性方法,并以PyPI Malregistry中的1,500个恶意和1,500个正常软件包分析相关神经元。 实验显示,增强促进检测的神经元并抑制阻碍检测的神经元可提高准确率,反向操作会使预测坍缩到单一类别;变化幅度与一致性明显依赖模型。不同模型在FFN层中表示检测行为的方式不同。探测安全知识相关神经元,有助于理解模型如何编码恶意编程概念、识别潜在有害记忆,并为神经元编辑、选择性遗忘与安全对齐提供线索。