论文
过程比输出更重要:区分人类与机器
Process Matters more than Output for Distinguishing Humans from Machines
摘要
随着大语言模型和自主代理在在线环境中的部署,可靠的人机区分变得越来越重要。现有方法评估系统是否可以产生与人类无法区分的行为或响应,遵循艾伦图灵提出的强调输出作为智能标准的标准。认知科学提供了另一种观点:评估行为产生的过程。为了测试认知过程是否能够可靠地区分人类和机器,我们引入了 CogCAPTCHA30,这是一个由 30 个认知任务组成的测试组,旨在即使在任务性能匹配的情况下也能引发诊断过程级特征。在整套测试中,流程级特征比单独的性能指标提供了更强的判别信号,即使在输出匹配的情况下也能可靠地区分人类和代理(平均流程特征分类器 AUC = 0.88)。为了评估代理过程差异,我们比较了现成的前沿代理(Claude Sonnet 4.5、GPT-5、Gemini 2.5 Pro)、Centaur(一种根据 1070 万个人类决策进行微调的语言模型)以及应用于 Qwen2.5-1.5B-Instruct 的两种特定于任务的微调方法:动作级监督微调(A-SFT)和过程级微调(P-SFT),直接优化过程特征。相对于现成的代理,对人类决策的广泛微调可以改善类人的任务流程,而特定于任务的流程级监督则进一步改善行为模仿。然而,当受监督的流程目标不能自然地跨任务泛化时,这种优势在跨任务转移下就会减弱。显式的过程级监督可以改善人类行为模仿,但前提是有适当的特定于任务的过程表示,这凸显了过程规范是在机器中实现类人认知过程的瓶颈。
