论文

超越代表性相似性:用于生成剽窃检测和候选源重新排序的源条件描述长度增益

Beyond Representational Similarity: Source-Conditioned Description-Length Gain for Generative Plagiarism Detection and Candidate Source Reranking

模型评测评测方法与指标

摘要

大语言模型 (LLM) 对学术诚信和同行评审提出了挑战。然而,生成剽窃检测仍然是一个尚未充分探索且基本上未解决的挑战。之前关于 LLM 生成的文本检测的工作目标是人工智能的参与,这可能是允许的,而不是源重用,而基于相似性的方法在广泛的重写和多源合成后陷入困境。受概率预测的描述长度视图(其中相关辅助信息可以减少目标序列的代码长度)的启发,我们引入了源条件描述长度增益(SCDG),这是一个定向 无需训练 框架,用于对比可疑文档 $P$ 的冻结语言模型的描述长度(有和没有候选源 $S$)。这种对比产生了 词元级 对数似然增益,用于衡量 $S$ 提供的增量预测证据。我们在 CLEF 生成剽窃基准的 PAN 上评估 SCDG。在 PAN 2025 衍生的成对基准上,SCDG 实现了 0.92 精度、0.97 召回率和 0.94 F1,优于所有基准;在 PAN 2026 的多源检索任务上,它达到 0.83 nDCG@10 和 0.96 Recall@100,超越了所有基线。在同一主题、同一事件的多新闻测试中,经过校准的增益分布 SCDG 分类器预测源重用仅为 $0.125\%$ 的对,支持在此评估协议下对主题重叠的鲁棒性。这些结果将 SCDG 确立为统一且可词元分解的信号,用于在广泛转换下重用特定于源的内容。