论文

路由上限与域无关:代码安全漏洞检测中的结构优先注入

Routing Ceilings Are Domain-Independent: Structural Prior Injection in Code Security Vulnerability Detection

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 在潜在能力和一致激活之间表现出有据可查的差距:路由器假设认为模型拥有解决任务的知识,但缺乏可靠的内部路由来激活它。正式数学推理方面的先前工作(SAIR,Cázares 2026)报告说,结构先验(备忘单)极大地提高了分布内性能,但崩溃到零样本基线分布外(OOD)以下 - 并且迭代重新校准放大而不是纠正崩溃。我们通过在源代码安全漏洞检测中重现 SAIR 设计,评估跨三个漏洞类别(CWE-798、CWE-284 和非 CWE N+1 反模式)的三个 LLM(GPT-OSS-120B、Llama-3.3-70B、Gemma-4-31B)跨越语法、上下文和语义复杂性,然后转移来测试这种现象是否跨域。备忘单增强提示来自 VUDENC(CWE-89、CWE-22)的真实 CVE 数据。我们的研究结果复制并扩展了 SAIR:(F1) 结构先验将所有模型的语义漏洞召回率从 20.0% 提升至 100.0%; (F2) 零样本性能沿着语义复杂度梯度下降; (F3) 使合成性能饱和的相同备忘单放大了真实 CVE 数据上的分布偏移崩溃(CWE-89:100% 合成 F1 到 VUDENC 上的 48.9%,-51.1pp); (F5) 迭代重新校准生成 v2 备忘单,其在实际数据上的性能比 v1 差,反映了 SAIR 的 AN45c-vs-AN38 发现。这些结果提供了证据,证明 SAIR 中记录的跨分布权衡表面可推广到代码安全性,并且路由器假设是跨域的。我们认为,崩溃的结构性质促使分布感知训练胜过及时校准。代码和评估脚本:https://github.com/bytepro-ai/bitcoder-v2-research