论文
MultiGhostBench:分布变化下长格式 LLM 生成的文本归因的多语言基准
MultiGhostBench: A Multilingual Benchmark for Long-Form LLM-Generated Text Attribution under Distribution Shifts
摘要
虽然 LLM 作者归属 (AA) 的现有工作已取得进展,但可用的基准仍然有限,通常侧重于英语、受控设置或相对过时的模型,少数多语言研究仅考虑相对较短的文本。我们推出了 MultiGhostBench,这是一个多语言基准测试,包含由最近的五本 LLM 生成的 928 本书,涵盖六种语言和三种脚本,每本书的平均长度约为 59K 字。该基准支持领域、作者和语言转换下的评估。对代表性 AA 方法的评估表明,没有一种方法能够在不同设置下始终表现最佳,并且在分布变化下性能通常会下降。基于 Transformer 的检测器可以跨语言保留与生成器相关的信息,尽管传输效率因语言对而异,而统计和基于指纹的检测器则更依赖于语言。我们设想 MultiGhostBench 成为开发和评估稳健的 AA 方法的宝贵资源。数据集和代码可以在 https://github.com/GrecoMT/MultiGhostBench 找到。