论文
通过约束策略优化进行检测器规避 LLM 释义
Detector-Evasive LLM Paraphrasing via Constrained Policy Optimization
摘要
人工智能文本检测器很容易受到释义和检测器引导的释义攻击,但现有的检测器规避方法通常缺乏对语义保留的精确控制。特别是,直接针对检测器规避进行优化可能会降低细粒度语义的质量,而标准化奖励设计仅提供对规避语义权衡的间接、权重敏感的控制。我们通过将检测器规避 LLM 解释为约束马尔可夫决策过程来解决此限制,其中检测器规避是主要目标,语义保留作为显式约束强制执行。我们提出了检测器规避策略优化(DEPO),这是一种拉格朗日原始对偶强化学习算法,具有新颖的 GRPO 风格的基于组的策略更新。 DEPO 在训练期间自适应地平衡语义保留和检测器规避,使策略能够提高指定语义保留区域内的攻击成功率。在 MAGE、M4、RAID 和同行评审数据集上进行的实验,针对 MAGE、RoBERTa、RADAR、Binoscopy 和 Fast-DetectGPT 检测器进行评估,表明 DEPO 实现了强大的检测器规避,同时精确满足语义保留约束。 DEPO 还表现出跨域、跨检测器和提示级的鲁棒性。