论文

SlopBench:我们如何通过 Slop 对语言模型进行排名?重复性人工智能写作的多领域基准

SlopBench: How Well Can We Rank Language Models by Slop? A Multi-Domain Benchmark of Repetitive AI Writing

模型评测评测方法与指标

摘要

SlopBench 询问哪些模型会产生僵硬、重复的散文,读者称之为 AI slop,一旦检测器将文本归类为机器编写的文本,就会出现这个问题。我们针对电子邮件、社交帖子、论文和工作场所聊天中的 112 项手写任务评估了 18 个模型,对每项任务的每个模型进行了最多 10 次采样,总共 19,928 个输出。 SlopBench 对四种表面行为进行评分,读者可以手动检查:每个任务指定的词带的长度、模型自己的一项任务样本的开头重复,以及针对 ChatGPT 之前的人类语料库的段落节奏和固定词汇结构。在一种固定权重下,Kimi K2.6 得分最低,为 21.1,Mistral Large 得分最高,为 40.6。在 500 次随机重新加权中,Kimi 在 58% 的抽签中得分最低,而 Mistral 在 97% 的抽签中得分最高。没有抽签可以保留十八个的完整顺序,并且场景引导程序可以准确地留下其中一个排名。我们对中间顺序进行了三项进一步检查:人群竞技场、人工智能检测器和词汇多样性。他们都没有确认订单。因此,我们分别报告这四种行为,并将综合结果视为众多行为中的一种权重,并发布提示、输出、参考统计数据和评分代码。