论文
当人工智能重写时,分类器放松:对讽刺和人工智能释义的社交文本的不确定性感知情感分析
When AI Rewrites, Classifiers Relax: Uncertainty-Aware Sentiment Analysis on Sarcastic and AI-Paraphrased Social Text
摘要
情绪分类器越来越多地应用于讽刺或人工智能生成的社交媒体内容——这两种分配机制的标准评估几乎无法提供指导。我们对这些条件下的情感分类器行为进行了三部分的实证研究。首先,我们发现讽刺文本的置信度得分显着低于非讽刺文本(Mann--Whitney $p = 2 \times 10^{-6}$),这证实了即使没有明确的不确定性建模,分类器也能感知到自己对讽刺内容的不确定性。其次,与直觉相反的是,我们表明情感分类器在 AI 释义评论上比在原始人类创作文本上实现了更高的准确度(RoBERTa:Qwen3.5-4B 释义为 $+5.8$ pp,Gemma4-E4B 为 $+3.7$ pp),揭示了跨域文体对齐效应:AI 释义消除了混淆 Twitter 训练的分类器的分布噪声,产生更清晰、更准确的结果。典型的情感文本。第三,我们证明了一个轻量级的弃权包装器——以低于 0.6$ 的置信度标记 $14\%$ 的输入——将保留集上的准确率从 82.2\% 提高到 88.9\% ($+6.7$ pp)。我们进一步将语义熵和 MC-Dropout 式分歧作为不确定性信号进行比较,并发现讽刺文本上几乎相同的 AUROC(0.650 美元 vs.0.646 美元),这表明对于简短的社交媒体输入,两种方法是可以互换的。我们的结果推动了在心理健康标记和内容审核等高风险情绪应用中从自信的单标签预测转向不确定性感知的弃权。