论文

过程比输出更重要:区分人类与机器

Process Matters more than Output for Distinguishing Humans from Machines

模型评测基准与评测资源

摘要

随着大语言模型和自主代理在在线环境中的部署,可靠的人机区分变得越来越重要。现有方法评估系统是否可以产生与人类无法区分的行为或响应,遵循艾伦图灵提出的强调输出作为智能标准的标准。认知科学提供了另一种观点:评估行为产生的过程。为了测试认知过程是否能够可靠地区分人类和机器,我们引入了 CogCAPTCHA30,这是一个由 30 个认知任务组成的测试组,旨在即使在任务性能匹配的情况下也能引发诊断过程级特征。在整套测试中,流程级特征比单独的性能指标提供了更强的判别信号,即使在输出匹配的情况下也能可靠地区分人类和代理(平均流程特征分类器 AUC = 0.88)。为了评估代理过程差异,我们比较了现成的前沿代理(Claude Sonnet 4.5、GPT-5、Gemini 2.5 Pro)、Centaur(一种根据 1070 万个人类决策进行微调的语言模型)以及应用于 Qwen2.5-1.5B-Instruct 的两种特定于任务的微调方法:动作级监督微调(A-SFT)和过程级微调(P-SFT),直接优化过程特征。相对于现成的代理,对人类决策的广泛微调可以改善类人的任务流程,而特定于任务的流程级监督则进一步改善行为模仿。然而,当受监督的流程目标不能自然地跨任务泛化时,这种优势在跨任务转移下就会减弱。显式的过程级监督可以改善人类行为模仿,但前提是有适当的特定于任务的过程表示,这凸显了过程规范是在机器中实现类人认知过程的瓶颈。

过程比输出更重要:区分人类与机器:论文配图
图 1:流程级行为特征比单独的任务表现提供了更强的人类代理区分信号。 A) CAPTCHA 提供了一个输出过程分离的现实世界示例。人类和前沿智能体(Claude Sonnet 4.5、GPT-5、Gemini 2.5 Pro)实现了相当的验证码性能,但在流程级交互功能(包括顺序点击模式、方向变化和过度选择行为)方面存在显着差异。 B) CogCaptcha30 包含 29 个认知任务(除了图像验证码之外),涵盖决策、记忆、感知和规划/推理,每个任务都与特定于任务的过程特征配对,旨在捕获行为如何随着时间的推移而展开。代表性示例说明了尽管多个域的流程级别签名不同,但任务性能却相匹配。误差线代表标准误差,各个点代表个体人类或代理参与者。 C) 人类和智能体之间的每任务输出距离,通过每个任务的主要性能指标(例如准确性、得分、奖励)的绝对 Cohen dd 来衡量。高于红色阈值的任务被认为是性能匹配的。许多任务表现出接近人类的代理性能。 D) 随机森林分类器的每任务交叉验证 AUC,经过训练可使用进程级特征区分人类和代理。尽管性能匹配良好,但流程级特征在大多数任务中仍然具有高度区分性,这表明输出等效并不意味着流程等效。