论文

超越最终参与者:为细粒度 LLM 生成的文本检测建模创建者和编辑者的双重角色

Beyond the Final Actor: Modeling the Dual Roles of Creator and Editor for Fine-Grained LLM-Generated Text Detection

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

大语言模型(LLM)的滥用需要对合成文本进行精确检测。现有作品主要遵循二元或三元分类设置,最多只能区分纯人类/LLM 文本或协作文本。这对于细致入微的监管来说仍然是不够的,因为经过 LLM 修饰的人类文本和人性化的 LLM 文本往往会引发不同的政策后果。在本文中,我们探索了严格的四类设置下的细粒度 LLM 生成的文本检测。为了处理这种复杂性,我们提出了 RACE(创作者-编辑者建模修辞分析),这是一种细粒度的检测方法,可以表征创作者和编辑者的不同特征。具体来说,RACE利用修辞结构理论(RST)构建创作者基础的逻辑图,同时提取编辑风格的基本话语单元(EDU)级特征。实验表明,RACE 在识别误报率低的细粒度类型方面优于 12 个基线,为 LLM 监管提供了政策一致的解决方案。