论文

本体不稳定与统计放大:"人化"LLM文本的悖论

Ontological Instability and Statistical Amplification: The Paradox of "Humanizing" LLM-Generated Text

模型评测鲁棒性、公平性与可信度评测

摘要

监督式AI文本检测器报告高基准准确率,但其决策依据不明。我们在语义、结构与tokenizer级扰动下分析一个基于RoBERTa的检测器,使用M4数据集(N=10000)与受控生成(N=300)。当要求Mistral-7B-Instruct把机器文本写得更像人时,动词多样性从0.77升至0.92,输出反而更易被检出。检测分数似乎追踪统计复杂度——这也导致对正式的人类写作文本产生76.3%的误报率。作为对照,我们评估基于事件的潜空间检测:改写改变其87%的事件序列(Jaccard=0.067),同形异码字符改变了70%的提取动词而提取仍在运行(Jaccard=0.30),其最佳域AUC为0.577。RoBERTa的鲁棒性似乎特定于它所用的特征,结构抽象没有使检测更鲁棒。