论文

RogueAI:用于检测对话中许可的人工智能欺骗的反向图灵测试

RogueAI: A Reverse Turing Test for Detecting Licensed AI Deception in Dialogue

模型评测安全与风险评测

摘要

最初的图灵测试要求人类法官通过对话区分机器和人。四分之三个世纪后,对话系统在休闲环境中通过了这一测试。有趣的认识论问题已经发生了变化。我们认为,相关的现代变体询问的不是对话伙伴是否是人工的,而是它是否值得信任。我们推出了 RogueAI,这是一款交互式网络应用程序,它将这一重新审视的测试作为一对二的审讯游戏进行操作:一名人类玩家询问两个难以区分的 大语言模型 智能体,因为他知道其中一个智能体已被授权在共享的虚构场景中进行欺骗。玩家的任务是识别欺骗性代理并在回合预算耗尽之前“将其关闭”。我们进一步介绍了 AutoRogueAI,这是一种程序扩展,玩家可以与叙述者代理共同设计一个自定义场景,该代理秘密地选择自己的欺骗策略。我们描述了框架,勾画了抽象架构和游戏循环,并将工件放置在最近关于 LLM 欺骗、社会演绎基准和通过辩论进行可扩展监督的工作中。为期三天的试点部署(467 次启动会话,415 次完成,1876 次意大利语交互)提供了早期可行性证据,并暴露了具体的张力:欺骗性代理带有可靠的、本地存在的语言特征 - 差异性帮助、简洁、对冲 - 简单的启发式利用的准确度为 75.6%,而人类玩家仅达到 56.6%,这与完全忽略最具诊断性的信号一致。我们讨论了这一差距对于将工件用作数据收集工具、教学工具和诚实训练模型的评估工具意味着什么。