论文

逆图灵台:评估语言模型作为人类与人工智能对话的法官

Inverse Turing Bench: Evaluating Language Models as Judges of Human vs. AI Dialogue

模型评测基准与评测资源

摘要

随着人工智能系统融入在线空间,在对话中将其与人类区分开来变得越来越重要。我们推出了 Inverse Turing Bench,这是一个基准测试,用于评估 LLM 和其他模型在多轮文本中区分人类和人工智能的能力。该基准提供了一组配对对话记录,其中一个对话是两个人之间的,另一个对话是人类和人工智能之间的。任务是正确识别哪些对话是纯人类对话,哪些对话是人类人工智能对话。我们根据该基准评估了一组初步模型,发现 GPTZero、Claude Opus-4.6 和 GPT-5.5 的准确率最高:分别为 89.41%、77.92% 和 75.94%。我们的结果表明,统计检测方法存在语义盲点,但语义方法很容易受到角色提示的影响。我们的工作涉及逆图灵测试,并推动人类与人工智能的差异化成为人工智能系统的关键能力。我们的实时基准测试可以在 https://huggingface.co/spaces/roc-hci/Inverse-Turing-Bench-Leaderboard 上找到。