论文
通过释义反转进行人工智能文本检测的无监督风格表示学习
Unsupervised Style Representation Learning for AI-Text Detection via Paraphrase Inversion
摘要
大语言模型 (LLM) 的快速发展引起了人们对抄袭、错误信息和自动影响操作等滥用的担忧,从而激发了对强大检测器的需求。最近的工作表明,书写风格的神经表征对于检测是有效的,而且最重要的是,对于击败大多数现有检测器的对抗性攻击具有鲁棒性。然而,当前基于风格的检测器依赖于作者标签进行训练,并且仅限于用于检测的小样本推理,需要可能并不总是可用的分布样本。我们通过训练风格编码器从机器生成的释义中重建人类创作的文本来学习没有作者标签的判别性风格特征;在训练期间冻结语义编码器会使风格编码器产生偏差,只捕获重建所需的非语义特征。我们通过两种检测策略评估学习到的表示:少数样本检测器和基于 DeepSVDD 的零样本检测器。在基准测试中,我们的方法在少样本设置中匹配或优于所有基线,并且在零样本情况下,在分布测试数据上与完全监督的分类器竞争,同时更好地推广到看不见的 LLM。除了检测之外,学习到的表征还可以推广到看不见的任务,在作者身份验证和细粒度风格辨别方面取得有竞争力的表现,尽管从未接受过这两个目标的训练。