论文

LA-CPD:定位人类与LLM合写文本的作者边界

LA-CPD: Local-Evidence-Aware Change-Point Detection for Human-LLM Authorship Segmentation

AI 基础设施AI安全与内容治理基础设施

摘要

随着LLM生成的文本变得越来越像人类,在人类与LLM共同撰写的文档中准确本地化LLM撰写的跨度对于涉及版权侵权、欺诈和人工智能生成内容的其他有害使用的案件中的归属和问责非常重要。句子级检测器提供本地作者身份证据,但即使在同一来源的句子之间,内容变化也会导致分数波动,从而产生虚假边界。因此,当作者身份转换的数量和位置未知时,恢复一致的文档分区仍然具有挑战性。我们提出了本地证据感知变化点检测(LA-CPD),这是一种将嘈杂的句子级评分序列转换为连贯的作者片段的结构化方法。给定来自冻结本地检测器的分数,LA-CPD 将长度加权的段内残差与加窗二均值对比度相结合,以捕获段一致性和候选切点周围的持续变化。动态规划优化每个候选计数的剪切位置,而 AIC 风格的标准选择最终分区,产生句子标签、作者边界和最大LLM创作跨度。在人类与 LLM 共同撰写的测试集上,LA-CPD 的表现优于 WCP+AIC,将句子级准确率从 0.747 提高到 0.796,同时改进了边界定位和 LLM 跨度描绘。