论文

人工智能辅助代码中幻觉包导入的贝叶斯校准检测

Bayesian-Calibrated Detection of Hallucinated Package Imports in AI-Assisted Code

AI 基础设施AI安全与内容治理基础设施

摘要

我们为 slopsquat 检测器提供了一个贝叶斯校准层——那些在 大语言模型 (LLM) 生成的代码中标记幻觉包导入的检测器。在现有管道发出二元决策(标记/不标记)的情况下,我们的层发出每次检测的 Beta 后验概率,该概率源自 3 类认知分类法,该分类法将每个先验明确分类为经验校准、建设性论证或工程判断追踪。除了主要的 200/404 注册表通道之外,校准层还利用 PyPI 元数据信号(包年龄、版本计数、作者描述符、摘要)来显示二进制注册表检测器遗漏的已注册但可疑的包,这是现实的后 LLM 发射攻击者政权。由此产生的风险感知原语可由下游 CI 门直接使用,并支持跨检测规则的有原则的阈值决策。我们在包含 1,734 个 Python 片段的合并语料库上评估校准——分层的 189 提示 BigCodeBench 切片加上 100 提示利基库压力测试集,跨四个云模型(Claude-Sonnet-4.6、Mistral-Large、DeepSeek-v4-pro、DeepSeek-R1)和两个本地开放权重代码模型的六模型面板生成(Mistral Codestral,Meta CodeLlama)。针对受 Mahmud 等人启发的重新实现的二进制基线。 ——它与我们的 真值 共享其注册表预言机,因此充当退化的上限而不是真正的竞争对手——校准层再现了严格的注册表检测,并在元数据通道上引入了经过良好校准的附加标志。我们通过 McNemar 配对测试和校准来评估探测器的不对称性,并使用标记子集预期校准误差和严格正确的全语料库 Brier 分数。