论文
揭示 无需训练 LLM 文本检测中的光谱机制
Unveiling Spectral Mechanisms in Training-Free LLM Text Detection
摘要
大语言模型 (LLM) 的快速发展使得区分人类书写和机器生成的文本变得越来越困难。 无需训练 检测提供了可扩展的解决方案,但常见的基于置信度的指标主要测量平均标记概率,并且经常错过人类书写特征的信号波动,我们称之为“生成活力”。光谱分析提供了一种捕捉这种活力的方法,但其机制和实际边界仍未得到充分探索。在本文中,我们从理论和实证角度分析光谱检测。我们将频谱能量与代理对数概率轨迹的方差联系起来,并解释更广泛的人类词元选择如何产生频域指标所使用的波动。我们进一步表明,该信号的强度取决于文本长度和采样范围:对于长的、连续的、受限的生成来说,光谱证据是最清晰的,而短的、碎片的、混合的和编辑的设置则需要互补的置信度和波动视图。这些发现阐明了频域检测何时起作用,并为未来的多维检测器设计提供了指导。