论文

DSIPA:通过情感不变模式分歧分析检测 LLM 生成的文本

DSIPA: Detecting LLM-Generated Texts via Sentiment-Invariant Patterns Divergence Analysis

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

大语言模型 (LLM) 的快速发展带来了新的安全挑战,特别是在检测用于错误信息、冒充和内容伪造的机器生成文本方面。大多数现有的检测方法都难以应对对抗性扰动、释义攻击和域转移的鲁棒性,通常需要限制对模型参数或大型标记数据集的访问。为了解决这个问题,我们提出了 DSIPA,这是一种新颖的 无需训练 框架,它通过量化受控风格变化下的情绪分布稳定性来检测 LLM 生成的内容。它基于 LLM 通常表现出情感上更加一致的输出的观察,而人类编写的文本则表现出更大的情感变化。我们的框架以零样本、黑盒的方式运行,利用两个无监督指标:情绪分布一致性和情绪分布保存,来捕获这些内在的行为不对称性,而不需要参数更新或概率访问。在最先进的专有和开源模型上进行了大量实验,包括 GPT-5.2、Gemini-1.5-pro、Claude-3 和 LLaMa-3.3。对新闻文章、编程代码、学生论文、学术论文和社区评论等五个领域的评估表明,DSIPA 比基线方法提高了 F1 检测分数高达 49.89%。该框架表现出卓越的跨领域通用性和对对抗条件的强大弹性,为不断发展的 LLM 环境中的安全内容识别提供了强大且可解释的行为信号。