论文
超越全局标量:协同 词元级 统计数据和深度语义进行对抗性 AIGC 文本检测
Beyond Global Scalars: Synergizing Token-Level Statistics and Deep Semantics for Adversarial AIGC Text Detection
摘要
大语言模型 的快速发展需要强大的机器生成文本检测。现有的范式通常遵循两个孤立的轨道。 无需训练 方法依赖于全局统计标量,例如困惑度,而基于训练的方法则利用语义隐藏状态。这两种方法在对抗场景中都表现出根本性的弱点。全局标量充当有损压缩,掩盖了交错文本中的局部概率突发性,而纯语义模型过度适合特定的指纹,并且仍然容易受到欺骗。为了暴露这些缺陷,我们引入了 MOSAIC,这是一个全面的对抗基准,包含全粒度攻击范围内的 16000 个样本。为了应对这些挑战,我们提出了 NeuroStat,这是一个弥合统计和语义差距的端到端框架。 NeuroStat 从单个因果语言模型主干捕获未压缩的 词元级 概率 logits 以及深层语义隐藏状态。我们通过宏观状态残差调制融合这些异构信号,该调制使用全局不确定性指标自适应地校准局部卷积特征。正交和对比损失进一步确保了互补表示的学习。大量实验表明,与最先进方法的严重退化相比,NeuroStat 在 MOSAIC 上保持了卓越的鲁棒性,为对抗性文本检测建立了新标准。代码和 MOSAIC 基准测试可在 https://github.com/TencentBAC/NeuroStat 获取。