论文
DWT-Fusion:用于 无需训练 LLM 生成的文本检测的基于信号的框架
DWT-Fusion: A Signal-Based Framework for Training-Free LLM-Generated Text Detection
摘要
在零样本和 无需训练 条件下检测 LLM 生成的文本仍然具有挑战性,特别是当检测器必须跨数据集、域和看不见的生成器进行泛化时。虽然现有的 无需训练 方法利用语言模型统计数据作为检测信号,但它们通常通过总结整体模型行为的全局度量来表征文本。因此,词元级 可预测性中潜在的信息丰富的局部和多尺度变化可能仍未得到充分利用。受此观察的启发,我们引入了 DWT-Fusion,这是一种基于 无需训练 信号的框架,用于使用代理因果语言模型生成的 词元级 对数概率序列的离散小波分析来检测 LLM 生成的文本。所提出的框架通过基于小波的多分辨率信号表示来分析这些序列,并从局部概率动态中导出检测信号。我们进一步评估了四种 无需训练 投票变体,包括等权硬投票、等权软投票、校准加权硬投票和校准加权软投票,以组合多个小波配置,而无需训练监督元分类器。我们使用 GPT-Neo-2.7B、GPT-J-6B、Falcon-7B 和 LLaMA-3-8B 作为代理模型来评估 HC3、M4 和 MAGE 上的框架。最佳单小波配置在 HC3、M4 和 MAGE 上的 AUROC 值分别为 0.9872、0.8185 和 0.7138。通过校准加权投票,最佳集成变体将 AUROC 进一步提高至 0.9919、0.8477 和 0.7471。这些发现表明,基于 DWT 的多分辨率评分和校准引导投票融合为 无需训练 LLM 生成的文本检测提供了有效且可解释的信号。