论文
$k$NNProxy:用于黑盒零样本 LLM 生成文本检测的高效 无需训练 代理对齐
$k$NNProxy: Efficient Training-Free Proxy Alignment for Black-Box Zero-Shot LLM-Generated Text Detection
摘要
LLM 生成的文本 (LGT) 检测对于可靠的取证分析和减少 LLM 滥用至关重要。现有的 LGT 检测器通常可以分为两大类:基于学习的方法和零样本方法。与基于学习的检测器相比,零样本方法特别有前途,因为它们消除了训练特定任务分类器的需要。然而,零样本方法的可靠性从根本上依赖于这样的假设:现成的代理 LLM 与通常未知的源 LLM 很好地一致,这一前提在现实世界的黑盒场景中很少成立。为了解决这种差异,现有的代理对齐方法通常依赖于代理的受监督 微调 或与商业 API 的重复交互,从而增加了部署成本,使检测器面临静默 API 更改,并限制了域转移下的鲁棒性。受这些限制的启发,我们提出了 $k$-最近邻代理 ($k$NNProxy),这是一个 无需训练 和查询高效的代理对齐框架,它将 $k$NN 语言模型 ($k$NN-LM) 检索机制重新用作固定代理 LLM 的域适配器。具体来说,通过固定预算查询或现有数据集,从目标反射 LGT 语料库构建一次轻量级数据存储。在推理过程中,最近邻证据会产生一个 词元级 预测分布,该分布与代理输出进行插值,从而产生无需代理 微调 或每个词元 API 输出的对齐预测。为了提高域转移下的鲁棒性,我们将 $k$NNProxy 扩展为代理混合 (MoP),将每个输入路由到特定于域的数据存储以进行域一致的检索。大量的实验证明了我们的方法强大的检测性能。