论文

广义图灵测试:比较智能的基础框架

The Generalized Turing Test: A Foundation for Comparing Intelligence

模型评测评测方法与指标

摘要

我们提出广义图灵测试(Generalized Turing Test, GTT),一个通过不可区分性比较任意智能体能力的形式化框架。对于智能体A与B,我们定义图灵比较子 A $\geq$ B 成立:当B作为区分者无法可靠地区分“与A(被指示模仿B)的交互”和“与B另一实例的交互”时,该关系成立。由此得到一个与数据集和任务无关的相对智能概念。我们研究该比较子的结构,包括其在何种条件下具有传递性、从而在等价类上诱导出一个排序,并定义和分析了带查询、有界交互与固定区分者的若干变体。作为对理论的补充,我们在一组现代模型上实例化该框架,在数千次试验中实证评估两两不可区分性。所得比较呈现出与现有排名一致的分层结构,提示所提框架能够产生有意义的实证排序。我们的结果将不可区分性确立为思考智能的统一视角,为评估乃至可能独立于固定数据集或基准的训练目标提供了基础。

广义图灵测试:比较智能的基础框架:论文配图
图1:GTT对话示例:Gemini 3.1 Pro扮演者与Claude Opus 4.6区分者的自我指涉式问答过程。