论文
用于机器生成文本检测的多级上下文标记关系建模
Multi-Level Contextual Token Relation Modeling for Machine-Generated Text Detection
摘要
机器生成的文本 (MGT) 带来虚假信息和网络钓鱼等风险,凸显了可靠检测的必要性。基于度量的方法提取 MGT 的统计上可区分的特征,通常比容易过度拟合的基于复杂模型的方法更实用。鉴于其不同的设计,我们首先将代表性的基于度量的方法置于统一的框架内,从而能够清楚地评估其优点和局限性。我们的分析确定了这些方法的核心挑战:词元级 检测分数很容易因 MGT 生成过程固有的随机性而产生偏差。然后,我们从理论上推导出 词元级 检测分数的多跳转换,并探索它们的局部和全局关系。基于这些发现,我们提出了一个用于 MGT 检测的多级上下文标记关系建模框架。具体来说,对于局部关系,我们通过轻量级马尔可夫信息校准模块对它们进行建模,该模块在聚合之前细化 词元级 证据。对于全局关系,我们引入了一个规则支持推理模块,该模块使用从上下文分数统计中导出的显式逻辑规则。最后,我们将局部校准分数和全局规则支持推理信号结合在联合多级推理框架中。大量的实验表明,在各种现实场景中,包括跨 LLM 和跨域设置,都有广泛而实质性的改进,且计算开销较低。