论文

C-HAT-Bench:评测中文人机协作文本的AI检测

C-HAT-Bench: Benchmarking Chinese AI-Text Detection Beyond Fully Generated Text

模型评测基准与评测资源

摘要

大语言模型(LLM)越来越多地通过修改或扩展人类草稿来参与写作,导致机器参与的形式和程度各不相同。然而,大多数机器生成文本 (MGT) 检测器仅针对完全人工编写的文本和完全人工智能生成的文本进行评估。由于人类与人工智能的协作可以削弱或重新分配与机器生成相关的线索,因此在这种二元设置下的强大性能可能会夸大检测器的可靠性。这种不匹配在中文中仍未得到充分探索:检测线索是由标记化和特定于语言的文本分布决定的,但跨越生产设置、域和生成器的受控资源仍然有限。为了填补这一空白,我们提出了中文人类与人工智能协作文本检测基准(C-HAT-Bench),这是一个统一的基准,它将来自五个领域的价值 5,000 美元的人类编写的源文本链接到使用前缀条件延续下的六个生成模型作为参考设置和三种协作生产模式生成的超过 240,000 美元的变体。我们通过四种协议评估 21 美元的检测器,涵盖零样本和预训练的监督文档级检测、边界定位和跨条件泛化。相对于前缀条件连续性,协作生产模式下文档级检测器的平均 AUROC 低 12.0\%$,其中检测器特定的最大相对下降达到 $44.4\%$。跨协作生产模式的转移也是不对称的,这表明给定生产环境中的性能并不能可靠地预测其他生产环境中的性能。