论文
人工智能探测器的基础模型看起来很人性化
Base Models Look Human To AI Detectors
摘要
随着人工智能生成的文本大规模进入现实世界,机构越来越多地使用商业人工智能文本检测器,特别是在教育和学术诚信工作流程中。我们报告了有关此类系统的令人惊讶的实证发现:当通过 GPTZero 和 Pangram 进行评估时,从基本模型生成的文本通常被认为是压倒性的人类文本,而由指令调整的对应模型生成的文本则不然。基于这一观察,我们提出了通过迭代释义(HIP)进行人性化,这是一种与检测器无关的管道,可以将基本模型最小化地微调为释义器并迭代应用它。与我们测试的基线相比,HIP 在商业检测器上的语义保留和检测器规避之间产生了更强的权衡。在 Llama-3 和 Qwen-3 系列中,模型尺寸从 0.6B 到 70B,HIP 不断提高探测器的人性化程度。我们的研究结果表明,当前的检测器更多地跟踪指令调整和本地上下文的伪影,而不是机器生成文本的任何不变概念。反过来,这要求探测器设计能够更明确地模拟这些因素。