论文

语言模型智能体中的时间、身份与意识

Time, Identity and Consciousness in Language Model Agents

模型评测评测方法与指标

摘要

机器意识评估大多只能看到行为。对语言模型智能体而言,这种行为就是语言与工具使用。这使得智能体即使在本应使这些陈述真正有分量的约束在决策时刻并未同时具备的情况下,也能就自身说出正确的话。我们将Stack Theory的时间间隙(temporal gap)应用于脚手架(scaffold)轨迹。这把评估窗口内各要素的分别出现与单一目标步骤上的同时实例化区分开来。随后,我们在有事实依据的身份陈述上实例化Stack Theory的Arpeggio与Chord公设。这产生了两个可从插桩脚手架轨迹中计算的持续性得分。我们将这些得分与五个可操作的身份指标联系起来,并把常见脚手架映射到一个能揭示可预测权衡的身份形态空间(morphospace)中。其结果是一套用于身份评估的保守工具包。它把“像稳定自我那样说话”与“像稳定自我那样被组织起来”区分开来。