论文
新术语,新毒性:基于共识的中文新词毒性检测通过搜索增强 LLM
New Terms, New Toxicity: Consensus-based Chinese Neologism Toxicity Detection via Search-Augmented LLMs
摘要
新词,即在含义或形式上出现的术语,可以作为有毒表达的新载体,就像“乡村女孩”作为针对女权主义的污名化标签一样。这种有毒的新词看似良性,但在公众共识中已经演变成有毒的用法,对审核系统提出了挑战,并且仍未得到充分探索。在本文中,我们研究了如何检测通过新词表达的隐含毒性。我们首先提出一种分类法,捕获有毒新词的起源和共识验证标准,然后构建涵盖广泛观察到的风险类别的词典。为了捕获基于公众共识的毒性,我们引入了 SeTox,这是一种搜索增强框架,使静态 大语言模型 (LLM) 能够纳入实时网络上下文以进行新词毒性检测。实验表明,即使使用 3B 规模的模型,SeTox 的性能也优于最近的大规模模型,证明了其可扩展性,可以将现实世界的知识纳入有毒新词检测。免责声明:本文包含令人反感的内容,可能会令某些读者感到不安。