论文

论人类与人工智能生成文本的不可区分性

On the Indistinguishability of Human v/s AI Generated Text

模型评测模型行为与机制分析

摘要

LLM 的快速改进使得区分人工智能生成的文本和人类书写成为一个紧迫的问题。旨在使机器生成的文本显得更加“人性化”的释义工具进一步放大了这一挑战。我们研究如何使用人类书写样本来策略性地解释机器生成的针对人类分布的响应。在人类和机器对相同提示做出反应的多样本设置下,我们表明,在简单的混合和稳定性条件下,重复释义使机器分布向经验人类分布移动。我们的结果得出了明确的收敛率,将分析扩展到有限样本设置,并描述了所需的人类样本数量和释义轮次如何与所需的误差进行缩放。