论文

StyleShield:通过连续可控的风格转移暴露 AIGC 检测器的脆弱性

StyleShield: Exposing the Fragility of AIGC Detectors through Continuous Controllable Style Transfer

应用与实践内容创作

摘要

人工智能生成内容(AIGC)检测器越来越多地部署在学术诚信筛查等高风险环境中,但它们的可靠性依赖于一个基本悖论:随着语言模型在人类编写的语料库上进行训练,随着模型的改进,人工智能和人类写作之间的统计界限将不可避免地消失。商业激励进一步扭曲了这种情况——检测服务和“去人工智能”工具通常在同一供应链内运行,用内容来源的判断取代了内容质量的评估。我们提出了 StyleShield,这是第一个用于条件文本样式传输的流匹配框架,通过具有以冻结 Qwen-7B 表示为条件的零初始化交叉注意适配器的 DiT 主干,直接在连续词元嵌入空间中运行。在推理时,我们将 SDEdit 范式从图像合成调整为文本嵌入,并使用单个参数 gamma 提供对逃避与保留权衡的平滑连续控制。在多域中文基准测试中,StyleShield 针对训练检测器实现了 94.6% 的规避率,针对三个未见过的检测器实现了 >=99% 的规避率,保持了 0.928 的语义相似度。我们进一步介绍了 RateAudit,一种文档级调度算法,该算法演示了检测率判决可以设置为任意值,直接质疑基于分数的评估的可靠性。