论文

人工智能相关内容和工件的统一检测框架

A Unified Detection Framework for AI-Related Content and Artifacts

模型评测评测方法与指标

摘要

人工智能(AI)是一把双刃剑:虽然它在广泛的领域取得了显着的成功,但其部署也需要有效的监督和监管,而对人工智能相关内容和工件的检测可能是最直接和最具成本效益的方法。为此,我们提出了一个基于马哈拉诺比斯距离分数(MDS)的统一检测框架,适用于多种重要设置,包括检测大语言模型(LLM)生成的文本、幻觉、水印和对抗性示例。该方法的一个关键组成部分是准确地表征正类(例如人类生成的文本、事实陈述、无水印文本或非对抗性样本),这需要在计算 MDS 之前对正样本深度表示的协方差矩阵进行高效且鲁棒的估计。由于正样本通常由多个类别组成,并且这些类别可能表现出同质性和异质性,因此我们为案例和单元最小协方差行列式(MCD)估计量开发联合估计方法。我们为两个估计器提供了有效的优化算法并证明了它们的收敛性。我们为联合估计器提供了击穿点的合理定义,并证明了它们相应的高击穿点特性。实证评估证实了所提出的检测框架的有效性。